行业资讯

加入亿拓客·流量大师 撬动财富之门!!!

具身智能研究报告

wang 2026-09-20 行业资讯

具身智能研究报告

——定义与界定范围 · 核心底层逻辑 · 路径设计与行事规则

研究日期:2026年9月3日 | 信息来源:全网公开文献检索(中英文,2024—2026)核心文献:郑南宁等《具身智能发展趋势与展望》(《中国工程科学》2026年第28卷第2期,全文已随报告存档于"原始文献"目录)


摘要(一页看懂具身智能)

具身智能(Embodied AI / Embodied Intelligence):智能体通过物理载体(本体)与环境进行动态交互,在"感知—认知—决策—行动"的闭环中不断学习、适应与进化的智能形态。它打破了传统AI将智能封闭于"大脑内部符号计算"的范式,主张智能不是孤立的信息处理,而是身体、大脑与环境三者持续动态耦合的涌现产物

精髓一句话:智能不在"想"里,而在"动"里——通过与物理世界的真实交互来生成智能,而非仅靠静态数据拟合。
核心机制:感知—认知—决策—行动的闭环学习系统 + 世界模型(预测未来)+ 表征学习(语义化)+ 因果推理(从关联到因果)+ 生成式大模型(统一接口)。
路径主线:模块化架构(SayCan)→ 端到端VLA大模型(RT-2/OpenVLA)→ "信息—物理—认知"三域融合大模型(LIPCM);数据上走"仿真训练场+真实试验场+数字孪生"三位一体的数据闭环;工程上走"云端大脑—边缘小脑—端侧本体"分层与轻量化部署。
阶段判断(2026年9月):具身智能正从技术验证期跨入产业化落地元年,人形机器人成为主流载体,中国市场占全球约65%,2026年上半年智元、宇树包揽全球前二(44%/31%)。

一、定义与界定范围

1.1 概念谱系:具身思想从何而来

1.
1950年 图灵:在《计算机器与智能》中首次提出机器不仅应"思考",还应能像人一样"行动",具身智能概念由此萌芽。
2.
1948年 维纳(控制论):同期提出"行为智能"思想,强调反馈与交互。
3.
1980年代 Brooks、Pfeiffer:发展行为主义智能与"身体化智能"理论;Brooks 1991年发表《Intelligence without Representation》(无表征的智能),提出分层子层架构(Subsumption Architecture),直接挑战"先表征、后行动"的经典范式。
4.
中国"863计划"智能机器人主题:我国科学家曾提出"物体的识别与行为交互智能",是本土早期探索。
5.
近年:随着大模型、算力与数据的突破,"通过物理实体与环境的交互使智能具备环境适应性与行为进化能力"才真正从理论变为工程可能。

1.2 权威定义(多源对照)

定义A(郑南宁院士团队,2026,最具系统性)

"具身智能强调智能体通过物理载体与环境的动态交互,在感知、决策与行动中不断学习和进化,从而突破传统静态数据训练模型的局限,展现出更强的环境适应性与泛化能力,已成为实现人工智能发展目标的关键路径之一。""具身智能是一种基于物理实体对环境进行感知与适应性交互,进而理解问题、产生智能行为的智能系统。"

定义B(中国信通院《具身智能发展报告》)

具身智能是以物理本体为载体,通过感知、决策与执行闭环与环境实时交互,能够自主适应环境变化、具备自学习自进化能力的智能形态。

定义C(学界通用表述)

具身智能是智能体(Agent)在物理或虚拟环境中,通过身体(Embodiment)与环境的持续交互,实现信息采集、认知重构与策略演化的闭环过程,由此涌现出的适应性智能。

定义D(李珍,《具身智能中的身体观》,2025-12)

"具身智能就是将AI融入机器人、新能源汽车等物理实体,为'大脑'赋予'身体',使其具有像人一样感知、学习和与环境动态交互的能力。"(并警告:若身体仅是物理载体、缺乏与环境的发展性耦合,则只是'伪具身','与一台程序化洗衣机并无本质差异'。)

1.3 "具身"二字的精确含义(界定关键)

"具身"≠ 有身体。费顿·李(李飞飞)指出:"具身"的含义并非单纯指代物理实体,而是与环境交互以及在环境中执行的整体需求和功能
实体身体观 vs 过程身体观:西方哲学传统是"我拥有一个身体"(身体是工具/载体,隐含形神二分);中国哲学传统是"我即是身体"(身体是生命展开本身,身心一如、知行合一)。后者被认为更能破解具身智能理论的逻辑困境(见第2.3节)。
具身学习的定义(郑南宁,引Glenberg 2004):认知根植于身体行动,经验建构于具身交互;生物体通过与环境交互积累具身经验,产生行为或行为潜能上的积极且持久的变化——这一过程称为具身学习。

1.4 界定范围:什么算、什么不算

(1)具身智能体五大核心要素(缺一不可)

1.
物理本体:承载感知与执行的实体(人形/四足/轮式机器人、无人机、自动驾驶车辆等);
2.
感知认知:多模态传感器(视觉、触觉、力觉、听觉、语言)实时捕获环境状态并语义化理解;
3.
规划决策:任务理解、推理与策略生成(LLM/MLLM/VLA大模型驱动);
4.
运动控制:执行机构施加物理作用,完成动作;
5.
记忆系统:情景记忆与技能库,支撑持续学习与泛化。

(2)覆盖形态(广义范围)

机器人平台:人形机器人(当前主流载体)、四足机器人、复合机器人、轮式/机械臂机器人、无人机集群;
移动智能体:自动驾驶汽车(Waymo、特斯拉、比亚迪、百度、小马智行)、自动导引车(AGV)、工业机器人(ABB、库卡、新松、极智嘉);
智能模型层:视觉-语言-动作模型(VLA)、具身世界模型、多模态大模型(MLLM)、"信息—物理—认知"三域融合大模型(LIPCM);
支撑体系:具身仿真平台(AI2-THOR、Habitat、Isaac Sim等)、数据体系(遥操作/仿真/人类视频)、具身芯片与传感硬件。

(3)边界与排除项(窄界)

对象
是否属于具身智能
理由
纯软件大模型/聊天机器人
❌ 否(离身智能)
无物理本体,不与物理世界交互
传统程序化机器人(按固定程序执行)
❌ 否(或"伪具身")
无"感知—决策—学习"闭环,无适应性进化
扫地机器人等固定逻辑产品
⚠️ 边缘
仅有简单环境交互,缺乏认知闭环与自进化能力
遥操作机器人
⚠️ 过渡形态
人在回路,正被端到端具身模型替代,同时是数据采集手段
具身智能体(机器+大模型+闭环学习)
✅ 是
满足五大要素与闭环交互

(4)三域划分(体系化视角)

具身智能横跨三大域并形成闭环:信息域(感知数据)→ 认知域(推理与理解)→ 物理域(动作执行),三域融合大模型(LIPCM)正是对这一闭环的模型化统一。

二、核心底层逻辑与精髓要义

2.1 哲学底层逻辑:从"离身智能"到"具身智能"的范式革命

笛卡尔身心二元论把心智封闭在大脑内 → 第一代认知科学将心智简化为"大脑内部抽象符号的运算与表征",身体只是被动外设(传感器/执行器)。此范式下的AI即"离身智能"(Disembodied Intelligence),包括符号主义AI与类脑计算。
离身智能的局限:在真实世界复杂、多变、充满不确定性情境下暴露无遗——静态数据训练无法构建与现实世界动态交互的闭环学习机制
20世纪50年代中期以来的认知科学范式转型:以"计算—表征"为核心的第一代认知科学让位于以具身心智为核心的第二代认知科学。核心洞见:智能行为绝非大脑中的封闭产物,而是主体的身体、嵌入其中的大脑以及周遭环境三者之间持续、动态、紧密耦合互动的涌现结果。
结论:"身体"从认知舞台边缘被推至聚光灯下——身体不再是认知的工具,而是智能不可剥离的核心维度与生成源泉

2.2 认知科学底层逻辑:4E认知与关键命题

命题
提出者
内涵
无表征的智能
Brooks (1991)
智能可以不需要内部符号表征,靠底层反射+行为控制直接产生
感知即行动
Dene
感知不是被动接收,而是通过行动主动"探询"环境
延展心智
Clark & Chalmers
心智不限于颅骨之内,工具与环境可成为认知过程的组成部分
生成/行动主义(Enactivism)
Varela, Thompson, Rosch
认知是有机体与环境"共同生成"的过程,认知即行动
4E认知
学界综合
Embodied(具身)+ Embedded(嵌入)+ Enacted(生成)+ Experiential(经验)
——智能是身体、环境、行动、经验的四重统一

核心观点(共识):智能行为不仅依赖内部信息处理能力,更取决于智能体的感知与行动能力;身体形态与生存环境深刻塑造智能本身。

2.3 计算底层逻辑:四大机制 + 一个闭环

具身智能的计算框架由"一个闭环 + 四个机制"构成(郑南宁2026体系):

闭环:感知—认知—决策—行动

多模态传感器实时捕获环境状态 → 表征学习语义化理解 → 认知推理与决策规划 → 执行机构施加物理作用 → 环境反馈回流 → 动态建模与策略优化……在连续时空维度中循环不息。

机制1:世界模型(对环境的预测基础)对物理世界进行抽象建模,构建可表征环境动态变化的虚拟系统——视觉场景、物理规则、人类行为逻辑都被编码进模型,使智能体具备对未来状态的预测能力。(代表:Ha & Schmidhuber《World Models》2018;Sora等视频生成模型被视为具身世界模型方向。)

机制2:表征学习(感知信息的语义化)将传感器原始数据(图像、点云、力觉信号)转换为机器可计算的结构化语义特征,支撑识别、理解与规划;交互反馈又反向调整表征,形成双向增强。

机制3:因果推理(高阶认知的关键)剖析"自身动作"与"环境反馈"之间的因果联系,预判行为后果、优化决策,实现从"关联认知"到"因果理解"的跨越,并支撑知识迁移与新环境快速适应。这是当前大模型的短板(黑箱问题)。

机制4:生成式AI(人机与环境交互的统一接口)LLM/MLLM/三域融合大模型承担任务理解、概念推理、知识与决策生成。具身智能据此分为两条交互线:

人机交互线:人用自然语言/图文下达任务 → 多模态大模型特征嵌入 → 任务理解与概念推理 → 生成知识与决策 → 本体生成对应行为;
系统与环境交互线:本体传感器完成情境具身感知 → 内部预测模型先行预测结果 → 大模型决策生成行为 → 行为输出执行。

关键规则:行动之前必须先预测(内部预测模型在行动前预判结果)。

2.4 系统底层逻辑:四大核心要素

"本体保障执行力,智能体赋予认知力,数据提供驱动力,学习框架实现持续进化。"(郑南宁2026)

1.
本体:智能落地的物理承载,连接虚拟与物理世界的桥梁;其能力边界直接制约智能体任务完成的范围与水平(身体决定认知边界)。
2.
智能体:决策与推理中枢,当代以深度神经网络(LLM/MLLM)驱动。
3.
数据:驱动智能进化的"燃料";场景越复杂,所需"规划—决策—控制"数据越多样,特定行业场景的高质量数据是未来成败的关键支柱。
4.
学习进化框架:通过智能体与物理世界的互动,实现对新环境的适应、新知识的吸收、解决问题能力的增强;初期靠虚拟仿真高效学习,关键是虚实之间的高效知识迁移(sim-to-real)

2.5 精髓要义(七条提炼)

1.
交互生智:智能的生成机制是"交互"而非"计算"——身体与环境的动态耦合是智能的来源,不是智能的手段。
2.
闭环为纲:无"感知—认知—决策—行动—反馈"闭环,即无具身智能;闭环频率与质量决定智能水平。
3.
身体即认知:身体不是载体而是认知的核心组成部分;"我即是身体"(过程身体观)优于"我拥有一个身体"(实体身体观)。
4.
预测先行:行动前先以世界模型/内部预测模型预判后果——这是具身智能区别于"试错蛮干"的分水岭。
5.
从关联到因果:相关学习只能模仿,因果推理才能迁移、适应与泛化;因果理解是具身智能的"高阶认知"标志。
6.
数据即经验:具身学习=积累具身经验并产生持久行为变化;数据闭环(交互产数据、数据强模型、模型促交互)是复利引擎。
7.
适应性是终极指标:一切设计服务于"复杂、动态、不确定物理世界中的适应与泛化"——这是具身智能区别于静态数据模型的立身之本。

2.6 离身智能 vs 具身智能(对照表)

维度
离身智能(传统AI)
具身智能
智能载体
大脑(服务器/芯片)
身体+大脑+环境三元耦合
数据来源
静态数据集(互联网/标注)
实时交互数据闭环
学习方式
离线训练、一次拟合
在线学习、持续进化
目标
求解问题、拟合分布
在物理世界中生存、适应、完成任务
失败模式
答案错误
动作失控(有物理代价,安全敏感)
泛化
数据分布内强、分布外弱
依赖闭环交互向分布外扩展
代表
聊天机器人、图像分类
人形机器人、自动驾驶、自主无人机

三、路径设计:技术、系统、数据、工程、产业、政策六条路径

3.1 技术路径总纲:"感知—交互—规划—仿真—训练—加速"六环体系

具身智能基础研究围绕这六个环节积累成果,MLLM与世界模型起关键作用:

1.
感知环:主动视觉、语义SLAM(如ORB-SLAM,动态环境高精度定位建图)、三维场景理解(Point Transformer等点云模型)解析复杂空间关系;视觉-触觉传感器(GelSight、DIGIT)融合多模态数据,提升物理交互精度。
2.
交互环:具身问答(EQA)、语言引导抓取为热点;基于LLM的自然语言解析与环境探索实现复杂指令理解。
3.
规划环:从模块化到端到端演进(见3.2)。
4.
仿真环:sim-to-real + 具身世界模型(Sora等生成模型模拟物理规律)提供高效交互学习环境;平台:AI2-THOR、RoboTHOR、Habitat、Isaac Sim;域随机化+人类干预校正缓解虚实差距(域差仍是待解难题)。
5.
训练环:建设可复现、可扩展的人形机器人训练场三类形态(见3.4);多模态数据:高精度动捕、力/触觉序列、同步多摄像头与深度、皮肤式触觉、语音交互日志。
6.
加速环:端侧实时性与能效双驱动;非结构化剪枝、知识蒸馏、低秩分解等模型压缩,适配Jetson等嵌入式平台。

3.2 模型路径:三代演进(当前处于第二代向第三代过渡)

代际
架构
代表
特征
局限
第一代(2022起)
模块化:"LLM规划器+技能库"
谷歌 SayCan(2022,"Do as I can, not as I say")
语言接地为机器人可供性,可解释、易调试
模块间信息割裂,端到端能力弱
第二代(2023-2025主流)
端到端 VLA(视觉-语言-动作)
谷歌 RT-2(2023,网络知识迁移到机器人控制,支持思维链推理与工具选择)、RT-H(2024,语言驱动动作层次结构,优化细粒度控制)、OpenVLA及各类开源VLA、视觉-语言-导航/规划模型
一个模型打通感知-语言-动作,泛化强
实时性、长程任务、因果理解仍不足
第三代(2025-演进中)
"信息—物理—认知"三域融合大模型(LIPCM)
 + 具身世界模型
各团队"具身基座大模型"(如宇树WVLA2.0、智元WorkGPT等具身大模型方向)
信息域(感知)、认知域(推理)、物理域(执行)知识统一整合,实现物理环境闭环协同
尚在演进,训练数据与算力要求极高

趋势判断:VLA已成为产业界公认的统一架构收敛点("感知-决策-执行"端到端闭环);单域大模型必然向三域融合大模型进化,这是具身智能模型层的主线方向。

3.3 系统路径:"大脑—小脑—本体"三层 / 云端—边缘—端侧协同

大脑(云端):三域融合大模型,承担全局知识融合、复杂推理、任务分解与长程规划;
小脑(边缘侧):实时运动控制、快速反射、低延迟推理;
本体(端侧):传感器阵列(眼/手/皮肤/耳)与执行机构(关节/灵巧手/轮足)。
部署逻辑:动态分层任务分配——云端负责"慢思考"(低频、复杂、全局),端侧执行"快反应"(高频、实时、安全关键),兼顾隐私与响应速度。
形态趋势:人形机器人成为具身智能理想载体(遵循"以人为本、协作智融"的"人本智造"新范式)。

3.4 数据路径:三类训练场 × 四大数据源 × 一条闭环

三类训练场

1.
真实试验场(受控场景):获取高质量力/触觉/动作数据(如RH20T数据集);
2.
混合现实场(物理+虚拟元素):生成跨域样本(如VinT-6D:视觉+触觉+本体感觉的大规模"手中之物"数据集);
3.
数字孪生平台(完整虚拟副本):支持并行化训练与回放(如AI2-THOR)。

四大数据源

1.
遥操作数据(人类专家远程操控真机,当前主力,成本高);
2.
仿真生成数据(世界模型/物理引擎批量生成,成本低但存在域差);
3.
人类视频数据(从互联网第一视角视频中挖掘操作先验,规模化潜力最大);
4.
真实交互数据(部署后"边用边学"回传,形成飞轮)。

数据闭环规则:交互产生数据 → 数据训练模型 → 模型提升交互能力 → 更多更高质量交互……(数据生态是中美竞争的核心战场:美国以仿真+开源社区见长,中国以真实场景规模+产业链数据见长。)

3.5 仿真与迁移路径:sim-to-real 三步走

1.
虚拟中高效学习:世界模型/物理引擎中低成本试错(模仿学习+强化学习);
2.
域随机化+校正:对仿真参数(摩擦、延迟、外观)随机化训练,结合人类干预校正,缩小虚实差距;
3.
真实世界微调:小样本实机数据对齐,完成知识迁移。

瓶颈:现有大规模仿真平台在复杂物体、动态交互、物理建模上仍显不足,域差(domain gap)是核心未解问题

3.6 工程路径:轻量化与边缘部署

模型压缩四板斧:剪枝、量化、蒸馏、低秩分解 + 神经架构搜索(NAS);
目标:百亿参数级能力在嵌入式设备低功耗运行,降低推理延迟、降低大规模部署成本;
芯片配套:专用具身芯片(算力/能效比)、端侧推理框架,与云端训练集群(万卡级GPU)构成"训边算"算力体系。

3.7 产业路径:上游—中游—下游全链条

上游:专用芯片(算力/能效)、高精度传感器(视觉/触觉/力觉/IMU)、轻高强材料、关节执行器、灵巧手;
中游:具身大模型与算法(VLA/世界模型/强化学习/模仿学习)、系统集成、测试认证机构;
下游六大场景
1.
工业制造:从搬运巡检走向芯片级组装检测、多车型柔性产线切换;
2.
医疗康复:手术辅助(依实时生理数据精准微创)、个性化康复训练;
3.
养老陪护:自然语言交互+情绪识别+情感计算的陪护服务;
4.
公共安全/灾害响应:四足+人形+无人机异构协同侦查、物资投送;
5.
城市基建巡检:无人机+地面机器人高频巡检桥梁/管线/输电塔并主动预警;
6.
家庭教育娱乐:低成本多功能机器人承担家务、陪伴。
产业形态:2025年已发布330余款人形机器人产品;2026年被称为"规模化落地元年"——量产、进厂、商业化验证成为主线。

3.8 政策路径(中国为主,2025—2026密集发力)

1.
2025年政府工作报告:首次写入"具身智能",与生物制造、量子科技并列新增长引擎;
2.
"十五五"规划建议:提出"加快发展具身智能等未来产业";
3.
工信部等《"人工智能+制造"专项行动》:具身智能列为智能制造核心方向;
4.
地方专项:北京(2025年6月)具身智能机器人专项政策、上海"具身智能三年行动计划"等;
5.
标准体系:2026年3月《人形机器人与具身智能标准体系(2026年版)》发布——六大板块65项标准,覆盖基础共性、安全伦理、智能等级分级等,标志行业从"野蛮生长"进入"标准牵引";
6.
资本与产业:宇树科技2026年8月科创板IPO(发行价150.80元/股);智元、优必选等相继上市/拟上市,国资+产业资本持续涌入。

四、行事规则与逻辑:具身系统"怎么做事"

具身智能的"行事规则"= 智能体在物理世界中运行的基本法则。它由底层逻辑(第二章)直接导出,是"交互生智"的操作化表达。

4.1 总规则:闭环律(一切行为的元规则)

感知 → 认知 → 决策 → 行动 → 反馈 →(新感知)…… 任何偏离闭环的行为都不是具身智能行为。闭环的三个推论:

感知必须服务于行动(Dene:感知即行动,主动探询而非被动接收);
行动必须产生可学习的反馈(无反馈的动作是浪费);
每一轮闭环都要更新内部世界模型(经验沉淀为知识)。

4.2 决策规则:快慢双通道(双过程理论)

1.
慢通道(战略层):大模型低频调用——任务理解、长程规划、异常处理、与人对话;允许"思考时间长",追求正确性;
2.
快通道(战术/反射层):小模型/控制回路高频运行——平衡、避障、力控、关节反射;毫秒级响应,追求安全与稳定;
3.
接口规则:慢通道输出意图/子目标,快通道执行并监控;快通道检测到危险时有权中止慢通道指令(安全否决权)。

对应RT-H的"动作层次结构"思想:用语言分层组织动作,高层语义、底层精细。

4.3 交互规则:预测先行 + 因果校验

1.
预测先行律:行动前必须经内部预测模型(世界模型)推演后果;预测置信度低于阈值 → 停止或降级动作(这是具身系统"谋定后动"的机制化表达);
2.
因果校验律:行动后比对"预期后果 vs 实际反馈",归因偏差来源(环境变了/模型错了/执行错了),据此更新模型——从关联走向因果;
3.
最小试探律:对新环境先用低成本、可逆的小动作试探,积累证据后再放大动作幅度(试错成本物理化的必然要求)。

4.4 学习规则:从虚到实、从模仿到自主

1.
先仿真后真实:虚拟环境低成本预训练,真实环境小样本精调(sim-to-real);
2.
先模仿后探索:模仿学习(人类演示/遥操作)打地基,强化学习/自主探索拔高度;
3.
经验固化律:成功行为沉淀为技能库与情景记忆,失败行为沉淀为约束与边界(记忆系统的两大职能);
4.
数据闭环律:部署即采数,运行即进化——"使用量→数据量→模型能力→使用量"飞轮。

4.5 安全与边界规则(物理世界的硬约束)

1.
安全优先律:物理世界中错误代价不可逆(伤人/毁物/自毁),安全约束凌驾于任务目标之上;2026年版标准体系将安全、伦理、智能等级分级单列板块;
2.
能力边界律:任务范围受本体能力边界硬约束(郑南宁:本体能力边界直接制约任务完成范围与水平)——"不做什么"与"做什么"同等重要;
3.
人机共在律:开放场景中保持可监控、可接管(人在回路是过渡期规则,目标是"人在环上"的分级自主);
4.
分级自主律:按任务复杂度/环境风险匹配自主等级(标准体系正在定义具身智能的"智能等级"分级方法)。

4.6 演进规则:从"能动"到"能干"到"好用"

能动(会走、会抓)→ 能干(完成任务、跨场景)→ 高效/好用(经济性、可靠性、规模化)。
当前产业整体处于"能动→能干"的跃迁期;"能用的场景"(工业产线、物流仓储、巡检)先行,"泛在场景"(家庭、开放空间)在后。

4.7 规则落地的四大现实约束(当前挑战)

1.
模型黑箱:大模型决策不透明、难预测,缺乏感知-知识-行为的因果理解机制 → 策略偏差与行为异常风险;构建世界知识支撑的因果推理机制是稳健安全运行的关键前提;
2.
算力对立:云端训练(万卡集群、高能耗长周期)vs 边缘部署(资源受限、低延迟要求)的双重挤压;
3.
数据稀缺:高质量多模态数据(三维空间、传感、轨迹)量少、模态单一、无统一采集标注规范,机构间数据封闭,缺乏共享机制;
4.
生态不成熟:软硬件成本高、标准体系初建、开源平台(数据集/运动控制训练框架)仍不完善、学科壁垒导致"部分之和<整体"。

五、最新进展速览(截至2026年9月)

产业与量产

2026年被业内称为具身智能/人形机器人"规模化落地元年",产业从技术验证转向量产交付与场景验证;
2026上半年人形机器人出货格局:智元44%、宇树31%,包揽全球前二;智元累计量产人形机器人1.5万台;
宇树科技2026年8月科创板IPO(发行价150.80元/股),开启"人形机器人第一股"新阶段;
特斯拉Optimus Gen 3启动量产准备;现代汽车计划部署2.5万台Atlas(2026年5月宣布);
2025年全年发布人形机器人产品330余款;2026年国内出货预测6.25万台(保守),乐观预期10万—20万台;
市场规模:2024年中国具身智能相关市场超8000亿元(宽口径,含自动驾驶/工业机器人等),2026年有望破万亿;人形机器人等核心口径全球市场已超900亿元,中国占比约65%(口径不同,注意区分)。

技术与模型

VLA统一架构成为行业收敛点:端到端"感知-决策-执行"闭环成为具身基座模型标准形态;
具身大模型密集发布:宇树WVLA2.0、智元WorkGPT等,聚焦通用操作与工业场景;
世界模型成为具身智能"第二大脑"的共识方向,视频生成/物理仿真模型加速融入;
灵巧手、关节电机、触觉传感器等核心部件成本快速下探,"硬件降本+模型提能"双线推进。

战略定位

英国图灵研究院将"具身智能与嵌入式AI的崛起"列为2026年十大科技趋势之首梯队;
中美竞争焦点:美国强在基础模型与仿真生态,中国强在场景规模、产业链与数据闭环;
中国"十五五"将具身智能列为未来产业重点,标准体系(2026版)落地,行业进入"政策+标准+资本"三力驱动期。

六、结论:具身智能的"一个本质、两条路径、三道门槛"

一个本质:智能是身体、大脑与环境动态耦合的涌现物——具身智能的本质是把"交互"确立为智能的生成机制,让机器在真实物理世界的持续行动中"长成"智能,而不是靠静态数据"喂成"智能。

两条路径

1.
技术路径:模块化(SayCan)→ 端到端VLA → 三域融合大模型(LIPCM)+ 世界模型;系统上"云端大脑—边缘小脑—端侧本体"分层;数据上"仿真+遥操作+人类视频+实机回传"四位一体闭环;
2.
落地路径:从"能动"到"能干"到"好用",工业/物流/巡检先行,家庭/开放场景在后;以标准(2026版标准体系)、安全、成本三要素决定落地速度。

三道门槛(当前主要卡点):

1.
因果与可控:大模型黑箱→需世界知识支撑的因果推理,解决可解释与可预测;
2.
算力与能效:云端训练与边缘部署的双重压力→轻量化+专用芯片;
3.
数据与生态:高质量多模态数据稀缺+生态不成熟→开放数据联盟、开源平台、行业标准。

一句话收尾:具身智能的底层逻辑是"身体即认知、交互即学习、闭环即进化";其行事规则是"预测先行、快慢分道、安全一票否决、小步试错、数据闭环";其路径设计是"模型向三域融合收敛、系统向云边端分层收敛、数据向虚实闭环收敛、产业向标准化规模化收敛"。


七、主要文献与资料来源

7.1 核心文献(全文已存档于"原始文献"目录)

1.
郑南宁, 杨勐, 姜维周, 孙宏滨, 丁宁. 具身智能发展趋势与展望[J]. 中国工程科学, 2026, 28(2): 1-13. DOI: 10.15302/J-SSCAE-2025.07.019.(在线出版2025-07-10)
2.
李珍. 具身智能中的身体观[N/OL]. 中国社会科学网(中国社会科学报), 2025-12-10. https://www.cssn.cn/zx/kjrw/202512/t20251210_5954978.shtml[1]

7.2 综述与学术资料(检索所得)

1.
Liu Y, et al. Aligning cyber space with physical world: A comprehensive survey on embodied AI. arXiv: 2407.06886 (2024).
2.
A Survey on Decision-Making and Embodied Learning. arXiv: 2508.10399 (2025).
3.
陶永, 万嘉昊, 王田苗. 构建具身智能新范式:人形机器人技术现状及发展趋势综述[J]. 机械工程学报, 2025.
4.
中国信息通信研究院, 北京人形机器人创新中心. 具身智能发展报告(2024/2025)[R]. 北京: 中国信通院.
5.
杨玉琪, 王梦云, 刘运卓. 具身智能及其在自主无人系统的应用研究[J]. 无人系统技术, 2024, 7(5): 99-110.
6.
中国人工智能学会(CAAI). 具身智能研究的关键问题[EB/OL]. 2025.

7.3 奠基性经典

1.
Turing A M. Computing machinery and intelligence[J]. Mind, 1950.
2.
Wiener N. Cybernetics[J]. Scientific American, 1948.
3.
Brooks R A. Intelligence without representation[J]. Artificial Intelligence, 1991.
4.
Pfeiffer R, Brooks R. Simple principles for building robot behaviors[C]. 1983.(行为架构)
5.
Dene P. Robot vision and articulated reachers[J]. 1981.(感知即行动)
6.
Clark A, Chalmers D. The extended mind[J]. Analysis, 1998.
7.
Varela F, Thompson E, Rosch E. The Embodied Mind: Cognitive Science and Human Experience[M]. MIT Press, 1991.(生成主义/4E认知)
8.
Glenberg A M. Embodiment as a unifying perspective for psychology[J]. 2004.
9.
Ha D, Schmidhuber J. World models[R]. arXiv: 1703.10722 (2018).
10.
Ahn M, et al. Do as I can, not as I say: Grounding language in robotic affordances (SayCan)[R]. arXiv: 2204.01691 (2022).
11.
Brohan A, et al. RT-2: Vision-language-action models transfer web knowledge to robotic control[R]. arXiv: 2307.15818 (2023).
12.
Belkhale S, et al. RT-H: Action hierarchies using language[R]. arXiv: 2403.01823 (2024).
13.
Peng X B, et al. Sim-to-real transfer of robotic control with dynamics randomization[C]. ICRA 2018.
14.
Fang H, et al. RH20T: A comprehensive robotic dataset[R]. arXiv: 2307.00595 (2023).
15.
Wan Z, et al. VinT-6D: A large-scale object-in-hand dataset[R]. arXiv: 2501.00510 (2024).

7.4 政策、标准与产业信息(检索所得,2025-2026)

1.
2025年《政府工作报告》("具身智能"首次写入);"十五五"规划建议(加快发展具身智能等未来产业);工信部等《"人工智能+制造"专项行动》.
2.
人形机器人与具身智能标准体系(2026年版). 2026年3月发布(六大板块65项标准,含安全伦理与智能等级分级).
3.
北京市具身智能机器人专项政策(2025-06);上海市具身智能"三年行动计划".
4.
高工机器人(GGII). 2026年具身智能/人形机器人出货与量产预测(2026-08).
5.
宇树科技科创板IPO招股信息(2026-08,发行价150.80元/股);智元机器人量产数据(2026上半年44%全球份额).
6.
现代汽车Atlas部署计划(2026-05);特斯拉Optimus Gen 3量产进展(2026).
7.
英国图灵研究院:2026年十大科技趋势("具身智能与嵌入式AI的崛起").

说明:产业数据来自公开报道与研究机构的不同统计口径(宽口径含自动驾驶/工业机器人等关联产业),引用时已标注口径差异;文献全文仅两篇完成下载存档,其余为检索摘要级引用,如需逐篇核对可按DOI/链接溯源。


报告完 · 2026-09-03

猜你喜欢

发表评论

发表评论: