

一、行业概述
PART 1
具身智能(Embodied Artificial Inteligence, EAI) 是指将人工智能能力嵌入机器人等物理载体,使智能体能够在真实物理环境中通过多模态感知、认知决策与动作执行完成任务的智能范式。其核心特征在于人工智能不再停留于数字空间,而是通过实体系统与外部环境持续交互,在“感知-理解-行动-反馈”的闭环中不断优化行为能力。与传统以信息处理为主的AI相比,具身智能强调认知能力与物理执行能力的统一,被视为推动AI从数字世界走向物理世界的重要路径。
从技术本质上看,具身智能包含三个核心要素:一是“环境交互性”(Interaction),即能够与物理环境进行实时双向交互的一体化,而非被动接收信息;二是“物理具身性”(Embodiment),即智能体拥有物理形态;三是“智能进化性”(Evolution),即能够通过与环境的持续交互不断学习和优化自身行为。学术界普遍认为,具身智能是实现通用人工智能(AGI)的必经之路。

具身智能核心三要素
从历史进程看,具身智能行业主要有四个发展阶段阶段:
(一)思想萌芽与早期探索阶段(1940s-1970s)
具身智能的演进历程可追溯至20世纪50年代,传统人工智能处于符号主义的鼎盛时期,研究者们认为智能的核心是“逻辑推理”,试图通过构建符号系统模拟人类的认知过程。然而,随着“框架问题”、“常识问题”等困境的出现,符号主义AI的局限性逐渐显现——仅依靠预设的符号与规则,无法模拟人类复杂的、动态的认知过程。在此背景下,哲学与心理学领域的具身认知思想逐渐兴起,为人工智能的发展提供了新的思路。
1949年,哲学家梅洛·庞蒂在《知觉现象学》中提出“具身知觉”的概念,强调人类的知觉并非仅由大脑完成,而是与身体的运动、姿态紧密相关,身体是人类与世界交互的基础;1950年,英国杰出的计算机科学家阿兰·图灵在其具有划时代意义的论文《计算机器与智能》(Computing Machinery and Intelligence)中,首次构想了一种能够与环境进行动态交互、具备自我学习能力的智能实体。该智能体被设想为能够像人类一样感知外界环境、自主规划行动路径、做出决策,并具备高效执行任务的能力,这一构想被视为具身智能(Embodied Intelligence)的初步理论框架;1966-1972年,斯坦福研究所研制出首个通用移动机器人Shakey,首次将“感知-规划-执行”的AI架构应用于真实机器人,实现了AI从纯逻辑计算向物理实体的跨越。

人工智能之父——阿兰·图灵
(二)行为主义与“无表征智能”阶段(1980s-1990s)
步入20世纪80年代,随着人工智能研究的不断深入,行为主义AI学派开始崭露头角,其中罗德尼·布鲁克斯(Rodney Brooks)等学者的研究尤为突出——他们提出“包容架构”(Subsumption Architecture)概念,主张智能不需要复杂的内部世界模型,通过简单的“感知-动作”规则层层叠加即可产生智能,强调通过感知与动作的紧密协同,设计能够与环境进行有效交互的智能机器。基于这一架构,布鲁克斯团队开发了“成吉思”(Genghis)机器人,该机器人能够在复杂环境中自主避障、行走,证明了通过身体与环境交互实现智能的可行性。基于成吉思机器人的实验结果,布鲁克斯于1991年发表《无表征智能》文章,正式确立了行为主义路线,证明了在动态物理世界中,简单的交互规则也能产生实时智能,为后来的端到端学习埋下伏笔。
这一时期的具身机器人实验主要聚焦于利用逻辑规则算法与机器人硬件的结合,以实现特定的应用功能。尽管这些实验尚处于初步探索阶段,但它们打破了传统人工智能“重认知、轻身体”的局限,确立了“具身性”与“交互性”在智能形成中的核心地位,为具身智能的发展奠定了重要基础。

“成吉思”(Genghis)机器人
(三)机器学习与感知控制阶段(2000s-2010s)
随着技术的不断积累与创新,具身智能迎来了快速发展的黄金时期。深度学习(Deep Learning)、强化学习(Reinforcement Leamning)等先进算法模型的涌现,为具身智能提供了强大的技术支持。2013年,Deep Mind团队提出了深度强化学习算法,将深度学习与强化学习相结合,使智能体能够在虚拟环境中通过试错学习自主完成任务。随后,研究者们将这一算法应用于机器人控制,例如,让机器人通过强化学习自主学习抓取物体的动作。这些算法模型使机器人能够更好地理解和处理复杂的环境信息,从而实现更加智能和灵活的行为。
同时,传感器(感知技术)与执行器(运动控制技术)等硬件技术的不断进步,也显著提升了机器人的感知敏锐度和行动精准度:在感知技术方面,摄像头、激光雷达、超声波传感器、力传感器等高精度感知设备的出现,大幅提升了机器人对环境的感知能力。例如,激光雷达能够精准测量机器人与障碍物之间的距离,为自主避障提供数据支持;在运动控制技术方面,伺服电机、液压系统、精密减速器等核心部件的性能提升,使得机器人的运动精度与稳定性显著增强。例如,工业机械臂的重复定位精度达到毫米级,能够完成高精度的装配、焊接任务。
在这一阶段,“具身”机器人技术取得了显著进展,不仅在仿生机器人研发方面取得了重要突破,还在“人工智能+机器人”的智能化融合上迈出了决定性步伐,是具身智能机器人概念兴起的阶段。例如,特斯拉的人形机器人Optimus通过先进的视觉-语言-动作模型以及精确的电机控制技术,实现了智能、拟人的交互,展示了具身智能在机器人领域的巨大潜力。

特斯拉Optimus具身智能机器人
(四)大模型爆发阶段(2020年至今)
近年来,随着以ChatGPT为代表的大语言模型(LLMs)的兴起,具身智能的发展迎来了新的高潮。大模型凭借其深厚的通用知识库和智能涌现能力,为机器人提供了更高层次的智能感知、自主决策和拟人化交互能力。
大模型与具身智能的融合主要体现在两个层面:一是大模型为具身智能提供高级认知与规划能力。传统的具身智能系统只能完成简单的、预设的任务,而大模型能够理解人类的自然语言指令,根据任务需求制定复杂的行动规划,并将规划分解为具体的动作指令。例如,当人类向服务机器人发出“帮我倒一杯水”的指令时,大模型能够理解这一指令,制定“走到饮水机旁-打开饮水机-拿起杯子-接水-走到用户面前”的行动规划,并将每个步骤分解为机器人能够执行的动作;二是具身智能为大模型提供真实世界的交互数据,促进大模型的优化。大模型的训练主要依赖于文本数据,缺乏对真实物理世界的理解,而具身智能通过与物理世界的交互,能够获取大量的多模态数据(视觉、触觉、运动数据等),这些数据能够丰富大模型的知识体系,提升其对真实世界的理解能力。
谷歌Deep Mind推出的RT系列机器人,尤其是RT-H版本,通过创新的任务分解与语言指令转化策略,实现了任务执行的高精度与高效率,进一步推动了具身智能在复杂任务处理方面的能力;Meta AI发布的Cortex Bench视觉评估基准以及专为具身智能设计的VC-1视觉模型,为具身智能的标准化评估与模型优化提供了重要工具;英伟达作为GPU和AI计算领域的领导者,在具身智能领域同样做出了显著贡献,他们推出了GROOT人形机器人基础模型及Jetson Thor新款人形机器人计算机,并对Isaac机器人开发平台进行了全面升级,为机器人技术的持续创新提供了有力支撑。
随着具身智能在技术上实现了多项突破,人形机器人能承担的任务越来越复杂,具身智能商业化落地速度逐步加快,涉及工业、医疗、家庭服务、自动驾驶、物流等多个领域,爆发式增长的趋势显著。

英伟达开源具身智能机器人——GROOT N1
二、具身智能核心技术概念解析
PART 2
具身智能作为人工智能领域的前沿方向,其关键技术涵盖物体操作、环境感知、任务理解与决策推理等四大核心部分,协同支撑起智能体在现实场景中的自主行动能力。
(一)感知层、决策层与执行层
从传统软件分层架构上分析,具身智能的各类技术可根据承担任务不同划分至感知层、决策层与执行层三个层级:
1、感知层
感知层负责通过视觉传感器、激光雷达、力觉传感器、触觉传感器、惯性传感器(IMU)、麦克风实现多模态融合,完成环境识别、人体检测、物体定位、力反馈感知。感知层是机器人获取外部信息的入口,其精度、实时性等直接影响后续决策与执行效果。当前主流方案采用多传感器互补融合,提升复杂环境适应性。视觉传感器负责识别物体与场景,力觉与触觉传感器保证操作安全与精准,惯性传感器保障姿态稳定,雷达提升导航可靠性。
2、决策层
决策层负责以具身大语言模型、世界模型、VLA(视觉-语言-行动)模型等为处理核心,实现任务理解、路径规划、操作推理、异常处理。决策层决定具身机器人智能水平高低。具身大语言模型实现自然语言交互与任务理解,世界模型构建环境虚拟表征,VLA模型实现感知到行动的直接映射,彼此之间有区别亦有配合。决策层需要强大的算力支撑与算法优化,实现端侧实时推理。
3、执行层
执行层负责以双足步态、动态平衡、灵巧操作、高精度力控为核心,实现稳定行走、精准操作、安全交互。执行层考验机械设计、运动控制、驱动技术、材料工艺的综合能力。双足步态与动态平衡是人形机器人最核心、最困难的技术点,需要在复杂地面保持稳定,应对碰撞、颠簸、斜坡等情况。
(二)类人仿生单元
人形具身智能是目前具身智能产业的主流,行业结合人形机器人的类人结构与机器人的运作方式,将具身智能各类技术划分至“大脑、小脑、肢体、灵巧手”等四个不同的仿生单元。
1、具身大脑
具身大模型是具身智能的“大脑”,负责理解自然语言指令、感知环境、规划任务序列。目前主流技术路线包括VLA模型路线、世界模型路线及以具身大预言模型+运动基元为代表的分层模块化运控路线三种。
2、具身小脑
运动控制是具身智能的“小脑”,负责将任务规划转化为精确的物理动作。核心挑战包括:双足行走的动平衡控制、全身协调运动规划、灵巧手的精细操作、接触丰富的柔顺控制。
3、具身肢体
具身智能的“肢体”包括物理躯干、关节、连杆、驱动器,人形机器人的四肢等。在双足行走方面,基于模型预测控制(MPC)和全身控制(WBC)的框架已成为主流。
4、灵巧手
具身智能的“灵巧手”包括机器人的多指末端与各类触觉传感器,自由度(DoF)是其核心指标。
具身智能的各个类人仿生单元与软件分层结构并不是一一对应的关系:比如具身大脑与小脑都属于决策层,分别为高层决策与中层运动决策;灵巧手也不仅仅是执行层与感知层,还有本地微决策的机能,遇到环境变化可以毫秒级调整握力,不需要等待大脑的大模型推理,类似于手指被烫瞬间缩回的本能反应。

具身智能的类人仿生模块划分
(三)具身感知
感知系统是生物体实现智能行为的逻辑起点,而在具身智能语境下,感知不再是孤立的信息接收,而是一个深嵌于动作-感知闭环中的动态过程。然而,这种从静态到闭环的范式转变,使得感知系统必须直面真实物理世界带来的挑战:由于单点观测的局限性,智能体必须具备主动感知与探索能力,通过改变位姿主动增强自身的感知能力;面对物理环境的复杂干扰,系统必须通过多模态信息融合利用跨模态互补性来增强鲁棒性;针对现实环境的随时间缓慢变化的特性,感知算法必须实现高效的动态环境自适应能力;此外,受限于移动机器人有限的板载算力,模型轻量化也成为了感知算法落地的重要环节。主动感知与探索是具身智能实现自主性和适应性的核心能力。
与传统的被动感知不同,具身感知强调智能体的主动性,即智能体能够根据任务需求,主动调整自身姿态、视角或交互方式,以获取更丰富、更相关的环境信息,从而更好地完成任务。主动感知系统并非全盘接收所有感知信息,而是基于任务目标和环境状态,有选择地关注特定信息。主动感知强调感知过程与动作的紧密结合。智能体通过控制自身的视角和交互方式,主动地获取有利于理解环境的感知信息。
例如来自中国团队搭建的MP5(Parser, Percipient, Planner,Performer, Patroller)智能体算法在Minecraft中实现了精细的环境感知策略规划,开发了目标导向的主动感知算法,能够处理更复杂的任务。Active GAMER利用3D高斯溅射的渲染特性评估环境重建任务的信息增益,驱动机器人主动规划最佳视角,实现了更优的全局重建性能。

MP5算法运行示意图
(四)具身推理
具身推理是指具身智能体通过多模态感知(如视觉、触觉、本体觉等)实时捕捉环境状态,融合行为目标与历史经验,从而将复杂任务分解为可执行的任务规划、并进一步类人地动态修正执行错误的认知框架。其典型应用涵盖机器人自主导航、操作顺序控制、人机交互等多个方面。通过闭环反馈机制,智能体在执行动作后持续监测和评估实际执行结果,并利用这些反馈信息更新内部认知模型和决策策略,实现自我反思调整和优化。这使得智能体能够自动分解复杂任务、适应环境变化并不断从经验中学习。例如,一个服务机器人在家庭环境中执行“准备早餐”这一复杂指令时,不仅需要理解自然语言描述的目标并将其转化为取物、烹饪、摆盘等一系列具体操作,还需根据实时感知到的环境状态调整计划。在这一过程中,具身推理将认知决策与物理反馈紧密耦合,使机器人在真实世界中表现出更高的鲁棒性和适应性。
近年来,随着大语言模型和多模态大模型的推理能力不断增强,推理能力不仅在自然语言处理领域取得了显著成果,也展现出在机器人规划与交互中的巨大潜力。大模型在具身推理中的作用主要体现在三个方面:
1、语义理解与目标分析:将模糊的自然语言需求转化为明确的目标是推理的基本表现形式。大模型通过对海量自然语言语料的学习,能够准确捕捉用户指令中的隐含需求,将模糊的描述转化为清晰、量化的目标。这种能力使得智能体在接收到“我渴了”这样的抽象指令时,能够转化为“倒一杯水并送到人的面前”这样的具体而清晰的目标,从而能够更好地呈现人和具身智能体之间的人机交互智能。
2、原子动作分解:将总体任务目标分解为可逐步推进的子任务,并转换为机器人低层技能可执行的原子动作序列,是推理能力的另一个重要体现。大模型需要将整体目标拆解为一系列连贯、可操作步骤。例如,谷歌提出的SayCan方法,对于用户提供的高层自然语言指令,大模型会输出一系列可能的子任务描述,然后机器人依据已学习的技能库和环境状态,通过机器人学中的价值函数或可行性模型对这些候选子任务进行打分,来选出当前最合适的原子动作。例如,面对指令“我把饮料打翻了,你能帮我吗?”,大模型能够规划出连贯的行动序列,诸如“走到柜台,拿起海绵,擦拭液体”等步骤。在每一步执行后,大模型根据新的环境反馈继续规划下一步,直到任务完成。

谷歌SayCan模型相较其他模型的不同之处
3、反思与调整:根据子任务的执行情况和实时环境反馈,调整原子动作规划,优化任务执行流程,则是具身推理呈现给具身智能体的环境感知的核心能力。例如,谷歌提出的VLP方法进一步结合视觉信息,并利用视频生成基础模型在任务执行前预演行动过程,通过树搜索评估每一步的合理性与可行性,使机器人在实际执行前便能识别潜在的风险,从而调整任务规划。在失败检查与反思方面,REFLECT框架通过LLM分析视觉基础模型反馈的检测结果,检查子目标是否达成,进而利用大语言模型进行失败原因推理和计划的实时纠正,该方法不仅能够检测执行错误(如物体被意外掉落),还能识别规划错误(如选择了错误的目标物体),为具身推理系统提供了重要的自我纠错能力。
(五)具身导航
具身导航是指在动态环境中智能体感知时空关联内容并与环境交互,进而移动到由特定坐标、物体、语言描述或图像指定的目标位置。该任务中,智能体处于未知环境中的某一随机初始位置,需要根据先前的导航经验来导航到指定的目标方位。具身导航的研究问题集中于如何学习导航的先验知识,这种先验知识应当在未知的、多样的环境中具有良好的泛化性,从而来帮助智能体基于这些经验来快速、高效地导航到目标位置。
与传统移动机器人中的几何导航模块相比,具身导航更加关注“引导机器人本体前往一个能够完成任务的位置”。传统导航通常以二维栅格或高精度地图为基础,在已知或弱变化环境中规划一条无碰撞、几何意义上的最短路径,导航目标多为预先给定的坐标点或静态路标,对机器人本体形态、相机视角、可操作区域以及任务语义的考虑有限。具身导航则将导航放在具身任务整体闭环中:一方面,目标可能以“找到某个可见/不可见物体”、“根据一句自然语言描述抵达某区域”等高层语义形式给出,智能体必须联合视觉、语言与本体状态进行推理;另一方面,导航结果不仅要求机器人抵达某个坐标,还要保证后续操作(如抓取、开门、插拔、电梯交互等)的可达性和舒适性,例如需要面向桌面、预留机械臂运动空间、兼顾视野覆盖和避障约束。
为了学习可泛化的导航经验,当前的方法可以分为需要训练和免训练两种类型,其中需要训练的方法可进一步划分成基于端到端强化学习和基于模块化学习两种类型。端到端强化学习方法将导航经验建模成端到端的策略网络,并通过增加情境记忆和改进视觉表示等方式来增强策略网络,整个策略网络通过在训练环境中的端到端强化训练方法进行学习。然而,端到端方法的能力受制于强化学习的采样低效、训练成本高等局限性。此外,由于缺乏显式的记忆地图,这还限制了其在复杂环境和长时序导航下的泛化能力。另一类是基于模块化的方法,这种方法通过构建语义地图来精确记忆空间关系,然后通过监督学习预测语义图边界或者通过自监督学习预测语义地图的未知区域,据此构建导航点预测模块并进行路径规划,从而寻找最有价值的导航方向以实现高效的探索。模块化的方法虽然通过引入记忆模块增强了泛化性,但面向新目标仍需要进行额外训练,所以泛化性提升有限。免训练的方法不需要额外的训练且可以适用于开放集合的目标,这些方法借助于视觉-语言模型(VLM)或大语言模型(LLM)来获取导航经验并实现动作的预测。在这类工作中,大量的工作将所感知的视觉内容转换为文本,然后将文本形式的环境内容以及历史信息输入大语言模型来预测导航动作。
(六)具身交互
具身主体与环境的交互是具身智能框架中的核心环节之一。智能体通过多模态传感器对环境进行细粒度感知,并基于感知结果在强化学习框架下进行决策与动作选择。在这一过程中,智能体与环境的每一次交互都会产生反馈信号,该反馈本质上是对其行为结果的评估。在强化学习语境下,这类反馈通常被形式化为数值奖励或惩罚,用于驱动策略的持续优化。通过“感知—决策—行动—反馈”的闭环机制,具身智能体能够在复杂动态环境中不断调整行为策略,实现对环境的自适应与持续学习。例如,在具身抓取任务中,是否成功抓取目标物体构成交互反馈;在具身导航任务中,是否到达目标位置或发生碰撞同样反映了交互结果。
人机在环的具身交互(Human-in-the-loop Embodied Interaction)是一种人类与智能体深度协同的交互模式,其核心在于通过引入人类参与,实现对智能体学习、决策与执行过程的有效调控与增强。该模式主要可分为两种典型形式:一类是基于人类反馈的在环机制,即人类通过主动提供反馈、指导与监督,参与智能体的训练与决策过程,从而提升其在复杂环境中的适应性与安全性。在该模式下,人类通常不直接参与具体任务执行,而是以“外部监督者”的角色对智能体行为进行校正与优化。近年来,这一机制已广泛应用于大语言模型及具身大模型中,尤其在处理高不确定性与长时序决策任务时,能够显著提升模型性能与稳定性。同时,人类反馈的引入还有助于增强模型的可解释性与可控性,从而提高系统整体的可信度;另一类是人类深度参与的协同交互模式,即人类直接进入具身主体的工作空间,与智能体共同完成任务。在该模式下,人类与智能体分别发挥各自优势:智能体依托其感知与计算能力执行具体操作,而人类则在复杂决策、异常处理及高风险环节提供关键支持。这种协同方式通常与具体应用场景高度耦合,例如在医疗手术、工业协作等高精度任务中具有重要应用价值。以手术机器人为例,具身交互不仅涉及机器人与物理环境的交互,还包括与人类操作员(如外科医生)的紧密协同。

人机在环的手术场景具身交互流程
三、行业产业链概览
PART 3
具身智能芯片产业链自上而下分为上游基础器件支撑层、中游软硬件集成层、下游商业应用层,其中上游的是产业链的技术底座和价值核心,占产业链总成本的60-70%,具体情况如下:

具身智能产业链示意图
(一)上游基础器件支撑层
产业上游聚焦AI芯片(负责端侧部署运行大模型,完成运动控制)、传感器(感知层硬件,包含视觉、力觉、IMU、触觉电子皮肤等)、减速器(负责关节传动,提升力矩)、行星滚柱丝杠(人形关节硬件)、电池电源系统等核心基础硬件。
当前,部分高性能硬件的国产化水平正在加速提升,以AI芯片为例,随着国产AI算力芯片的突破和进步,2025年上半年年中国加速芯片市场中本土AI芯片品牌的市场份额已突破30%。整体而言,中国具身智能产业链的自主可控能力在持续增强,但距离完全自主化仍有相当距离。

具身智能产业链上游国产化进程情况
(二)中游软硬件集成层
产业中游是机器人本体集成环节,各类企业将硬件零部件与软件算法整合为整机产品。从软件算法层面看,中游企业普遍采用混合技术架构,极少使用单一纯技术路线。从具身智能本体形态看,目前主要有全尺寸双足人形、四足机器人、轮式人形机器人三大类别:
1、双足人形机器人
双足人形是远期通用形态,也是未来最有想象空间的细分市场,当前还处于量产验证期。双足机器人硬件包含双足、双腿、躯干、双臂及灵巧手等部位,灵巧手自由度较高;针对大脑的需求很高,普遍使用VLA、LLM+运动基元、世界模型WAM作为大脑模型;针对小脑的控制水平要求极高,要求智能体具备动态平衡、抗干扰的高水平能力。
双足智能体运动表现类似人类,可走楼梯、坡道、非结构化地面,搭配高灵活度灵巧手,可灵活使用人类常用工具,极度适配人类工作场景,如家庭作业、人员陪伴看护等。但目前双足智能体采购成本高,因能耗较大续航能力较差、稳定性差,维护成本高,故而尚未进入大规模商用阶段,仍处于科研实验阶段,少部分用于工业场景试点。
2、四足机器人
四足机器人(机器狗)目前已在特种巡检作用中完成了应用验证。四足机器人硬件包括机械腿,可搭载机械臂、负载躯体等部位;因执行任务以感知巡检为主,操作型任务较少,故对大脑的需求较低,智能模型普遍轻量化;针对小脑的控制水平要求低于双足智能体,因整体重心较低,四足支撑较稳,摔倒风险低于双足智能体。
四足智能体地形适应性最高,可适应台阶、碎石、斜坡、管廊或其他户外复杂地形,越障能力最强,同时价格与续航处于三类机器人的中等水平,可用于电力巡检、矿山巡检、消防搜救、油气特种作业等场景。但四足机器人本体不包含灵巧手部位,臂操作能力弱,不适合精细双手作业,想要完成操作任务需要外接机械臂实现。
3、轮臂式机器人
轮臂式机器人是当前工业落地最快的形态。轮式机器人硬件包括全向轮底盘、上半身躯干、单/双摇臂、灵巧手等部位;和人形双足智能体类似,轮式机器人执行任务以操作为主,对大脑的需求和双足智能体类似,需较高级别的智能水平,普遍使用VLA、世界模型等软件底层;因轮式底盘运动控制成熟,针对小脑的控制水平要求最低,主要压力集中在单/双臂操作控制上。

星动纪元轮式双臂机器人
轮臂式智能体地仅适合硬化平整地面,无法爬楼梯、碎石路面,受场地的限制程度最高,只能应用于室内平整场地场景,如仓储分拣、商超理货、药房、展厅服务等。但因其采购成本、能耗最低,同时具有底盘稳定和灵巧手可操控水平较高的优势,目前在三类智能体中商业化进展最快。
(三)下游商业应用层
在下游商业应用层中,主要有工业制造、商业服务、家庭消费、特种作业(极端环境作业)等四大主要场景。

具身智能主要商业应用场景
1、工业场景是当前最成熟、最刚需的方向,涵盖汽车/3C装配、检测、物流、搬运、巡检,2026年开始进入试点落地阶段。工业场景环境相对规范、需求标准化、付费能力强、政策支持力度大,是具身智能商业化的第一突破口。其中,汽车制造是最优先落地行业:该产业产线标准化程度高、对自动化接受度高、人工成本高、重复性任务多,人形机器人可参与装配、巡检、物料搬运、喷涂、焊接辅助等环节。汽车行业具备资金实力强、技术接受度高、供应链完善等优势,是人形机器人规模化落地的最佳试验场;3C电子行业对柔性生产要求高,产品迭代快,传统自动化设备难以适配,人形机器人凭借通用性、灵活性具备显著优势,可在组装、检测、上下料、包装等环节替代人工。3C行业产线调整频繁,对设备柔性要求极高,人形机器人能够快速适配不同产品与工序,大幅提升产线效率;电力、能源、轨道交通行业对巡检需求刚性强,环境复杂、危险程度高、人工巡检效率低,人形机器人可实现24小时自主巡检、异常识别、数据回传,提升安全性与效率。在变电站、电厂、铁路、隧道等场景,机器人能够替代人工进入高危环境,降低安全风险。
2、商业场景具体包括零售、餐饮、酒店、展厅、安防、导览等,降本效应明确。2026年开始逐步试点,预计2027年进入规模化扩张阶段。商业场景对人机交互要求高,注重形象、语音、服务体验,是提升品牌形象与服务效率的重要载体。商场、展馆、酒店、政务大厅等场景,对机器人接受度高,愿意为体验与效率付费。
3、家庭场景包括陪护、助老、清洁、家庭服务等,未来市场空间最大,但安全、伦理、成本要求极高,预计2028-2030年开始步入商业化进程。家庭场景碎片化程度最高、环境最复杂、安全性要求最严格,必须等待技术成熟、成本下降、信任建立后才能大规模普及。中国老龄化加速,家庭服务机器人长期市场空间极为广阔。
4、特种场景壁垒高、单价高、批量小,属于长期优质赛道。包括康复护理、手术辅助、应急救援、勘探探测、空间作业、极端环境作业等,对可靠性、安全性、专业性要求极高,进入难度最大,但成功验证后可形成极高的护城河,是未来行业重要的盈利领域,预计2035年开始启动商业化。
四、主流核心技术路线分析
PART 4
目前具身智能大模型(大脑)主要有VLA、LLM大语言模型+运动基元(分层模块运控)、世界模型WAM等三类路线。随着产业的不断发展,这几条主流路线开始逐步融合,主流产品普遍采用混合架构——高层语义使用 VLA、WAM进行理解和拆分,底层运动执行使用分层运控。具体情况如下:
(一)VLA(Vision-Language-Action,视觉-语言-动作)模型
VLA模型通过融合实时视觉感知、自然语言理解和动作控制三大模块,为多样化机器人任务提供了通用解决方案,被视为新一代机器人智能中枢,在全球学术界和产业界引发高度关注。目前VLA模型主要有三大技术路线:
1、VLM+动作模型架构
采用视觉-语言大模型(Visual-Language Model, VLM)解析任务指令和视觉信息,通过知识推理引导动作模型生成控制指令。典型应用如叠衣服、餐盒整理等精细化操作任务。2024年中,Physical Intelligence发布了π0模型,依托互联网级数据训练的VLM主干网络,通过跨构型预训练+单构型后训练,实现洗衣机取衣、餐盒折叠等家庭服务能力;清华大学发布了RDT模型,以动作模型为核心架构,通过跨构型数据集从零开始的预训练,结合双臂机器人后训练,成功完成双臂倒水、游戏手柄操控等任务。2025年,Figure AI发布了VLA部署到人形机器人作业,该模型采用 VLM 与动作模型的解耦设计,感知数据并行输入这两个模型。该架构完整部署两个模型能够支持杂乱桌面整理等复杂任务,也可通过只部署动作模型实现包裹分拣等基础任务。
2、VGM+动作模型架构
基于视频生成模型(Video-Generation Model, VGM)预测任务执行过程的视觉轨迹,通过视频表征逆向推导控制指令。适用于需要预判连续动作序列的复杂操作场景。与基于VLM+动作模型的架构类似,基于VGM+动作架构的技术路线也有两类。单一模型方面,字节跳动发布 GR-2模型,采用大规模人类视频数据预训练+小规模机器人数据后训练的方式,实现可泛化的物品分拣任务;在分层架构方面,学术界产生了一些相对较小但也极具代表性的模型,例如清华大学提出的ATM,使用关键点光流作为中间表征解耦视频预测和动作模型,实现少样本机器人数据微调下的技能学习。
3、VLM+Latent+Action架构
为了充分利用各类异构数据,增强策略的泛化能力,将互联网图文数据和机器人数据混合训练,模型通过预测隐式动作标记(Latent Action Tokens) 来弥合图像-文本输入与机器人执行动作之间的鸿沟。为了充分利用各类异构数据,增强策略的泛化能力,2025年初智元提出 Vision-Language-Latent-Action (ViLLA)具身操作大模型。与VLA架构相比,ViLLA通过预测隐式动作标记(Latent Action Tokens),弥合图像-文本输入与机器人执行动作之间的鸿沟,在真实世界的灵巧操作和长时任务方面表现卓越,远远超过了已有的开源模型。ViLLA架构是由VLM+混合专家(MoE)组成,其中VLM借助海量互联网图文数据获得通用场景感知和语言理解能力,MoE中的隐式规划器(Latent Planner)借助大量跨本体和人类操作数据获得通用的动作理解能力,MoE中的动作专家借助百万真机数据获得精细的动作执行能力。在推理时,VLM、Latent Planner和Action Expert三者协同工作。
(二)WAM(World-Action-Model,世界动作模型)
在2026年,随着视频模型的进一步成熟,将视频预测和动作预测融合到同一个模型中的世界动作模型WAM,提升了基于仅动作预测的VLA的泛化能力,成为了业界关注的新热点。世界模型简单来说就是在具身智能内部构建物理世界的虚拟模拟器,先预测未来多帧视频状态(想象下一步世界会变成什么样),再基于预测结果生成最优动作。

世界模型构建的自主智能整体架构
为了帮助机器人感知和理解世界,视觉Transformer(ViT)等视觉模型将图像的视觉特征映射至模型空间中,使机器人能够识别环境中的关键物体;Robo Craft通过图神经网络捕捉底层系统的结构;PointNet对三维点云进 行函数编码以捕获环境的空间特征;Gornet等将通过局部搜索路径获得的 观测集合,扩展为其潜在空间中的全局表示,使机器人能够跟踪和接近特定的目标。
在完成感知和理解环境状态的基础上,机器人需要根据任务需求预测下一步行为,自主完成行为运动并判断当前决策对未来的影响。MORL引入了单调双曲模型来预测并更新行为策略,Trajectron通过条件变分自编码器计算未来轨迹的概率分布来预测环境。此外,更多模型使用基于扩散模型和Transformer的视频生成方法进行未来状态预测,如 VIPER利用预训练的自回归Transformer,引导机器人正确地执行任务,而 Genie通过历史视频信息和动作序列来预测环境的下一个状态。此外,GR-2通过大规模互联网无标签视频进行预训练并在机器人任务上进行了微调,实现了机器人对未来图像的准确预测和动作轨迹生成。
世界模型赋予了智能体预测未来状态的能力。相较于VLA通过海量样本学习并建立映射的模式,世界模型能够预见可能的状态变化并主动反应,对开放领域的泛化能力最强,可对未知环境进行主动推演,形成自主智能能力。但是对算力依赖度极大,需要对巨量视频进行交互处理,模型大多配置在云端运行,仿真-现实的gap较严重,运作顿挫感强烈。
(三)LLM+运动基元
大语言模型+运动基元(LLM+Skill Primitive),是指用大语言模型进行任务理解和分解,将复杂任务拆解为预定义的运动基元序列,再由底层运动控制器执行,是将大语言模型与传统工程派的分层模块化运控结合的路线。其优点是可靠性高、可解释性强(即智能体的运动动作可与大模型调用的基元进行对应),缺点是灵活性受限(只能基于已有基元库完成任务,无法完成新运动),难以处理训练数据之外的新任务。
在实践中,大语言模型凭借其对现实世界环境和机器人任务的高层次先验知识,能够通过思维链推理有效规划复杂任务,SayCan方法使用预训练技能增强大语言模型,使其能够在特定场景下提供符合环境上下文的规划结果;Inner Monologue方法则引入环境反馈机制,通过碰撞检测、场景描述和任务成功反馈等来构建闭环系统,动态调整规划策略以应对复杂的环境;DoReMi则利用视觉语言模型作为检查器,在每一步验证场景约束是否满足;LLM-Planner通过检索相似任务生成提示词,增强大语言模型对未见任务的规划能力,并支持基于环境观察的重新规划,有效提升模型的泛化能力。
在拆分理解任务后,智能体通过运动基元完成任务的执行。运动基元是指预先封装好、物理上可稳定执行的原子动作单元,如伸手、抓取、拧瓶盖、平移手臂、行走、开门等。每个基元内部已经封装好动力学、轨迹、力控逻辑,由具身小脑(WBC/MPC 运动控制器)负责执行。
五、主要国家发展情况
PART 5
具身智能作为AI与机器人的交叉领域,对科技发展的依赖度极高。在全球范围内,美、中、日、韩、欧盟等科技水平处于世界第一梯队的国家和地区是目前具身智能产业的主要参与者。
(一)美国情况
美国将具身智能视为下一代人工智能与先进制造的核心,凭借在AI基础研究、大模型训练和风险投资方面的绝对优势,在具身智能的“大脑”层面保持世界领先。国防部、能源部持续支持基础研究,特斯拉 Optimus、Figure AI推动人形机器人工程化与量产,谷歌 DeepMind、英伟达构建具身模型与生态体系,意图以技术标准与底层平台抢占产业制高点。
美国的战略逻辑清晰:以基础技术创新为核心,以龙头企业为牵引,以生态体系为壁垒,掌控全球产业价值链顶端。政府、科研机构、科技巨头形成协同创新体系,从基础研究到工程化落地无缝衔接。

美国主要的具身智能支持政策
(二)中国情况
中国将人形机器人纳入“未来产业”重点支持方向,从国家规划、地方政策、产业基金、场景试点多维度发力。依托全球最大制造业体系,中国正在快速形成 “核心技术+整机+场景+资本”全链条生态,具备规模化落地的独特优势。
国家层面出台多项政策支持机器人产业创新发展,地方政府纷纷设立产业园区、专项基金、应用试点,为行业发展提供良好政策环境。中国的优势在于产业链完整、应用场景丰富、工程化能力强、市场空间巨大,能够快速将技术转化为产品与商业价值。

中国主要的具身智能支持政策
(三)日韩与欧洲情况
日本、韩国依托减速器、伺服系统等精密制造基础,重点布局服务机器人、养老机器人领域,并与全球整机企业深度绑定,占据高端供应链环节。日本聚焦老龄化社会需求,大力发展护理、康复、家庭服务机器人;韩国则在半导体、精密加工基础上,推动核心零部件与整机协同发展。两国均走 “部件强国 + 场景深耕” 路线,在全球产业链中占据关键环节。
欧洲各国强调安全、伦理、可靠性,在标准制定、合规体系、工业级应用上具备较强话语权,同时积极推动具身智能在工业升级、医疗健康、公共服务领域的应用。欧洲注重技术与社会的协调发展,对安全、隐私、伦理的要求更为严格,这也使其在高可靠性、高安全性场景中具备优势。

欧盟主要的具身智能支持政策
六、产业市场竞争格局
PART 6
(一)市场整体情况
1、市场规模情况
全球具身智能产业正处于高速增长期。根据IDC于2026年发布的报告显示,全球具身智能市场2025年规模在210亿美元左右,2026年将突破300亿美元大关,预计到2035年将达到1.5万亿美元的规模。
从增速结构看,人形机器人赛道增速显著高于行业整体水平——2026 年全球人形机器人市场增速预计超过240%,远高于具身智能行业平均增速,成为拉动行业增长的核心动力。从出货量来看,2025年全球人形机器人出货量约1.8万台,较2024年的约3000台同比增长约508%。2026年预计全球出货超6万台,增幅超400%。从地区出货量看,2025年中国企业合计占据全球约74%的出货量份额。其中,宇树科技以超过5500台的出货量位居全球第一。

全球具身智能市场规模预测
2、资本市场运作情况
2023年之前,具身智能赛道融资以科研机构、小型初创企业为主,年度融资规模不足8亿美元,属于小众投资赛道;2023年随着ChatGPT引爆AI浪潮,具身智能成为AI落地的核心方向,特斯拉Optimus、优必选等企业产品逐步成熟,全球资本开始密集布局,行业进入融资爆发期。
2023年全球具身智能赛道融资额约27.78亿美元,2024年增长至48.61亿美元,2025年突破100亿美元,2026年预计超150亿美元。从区域分布来看,中国市场融资额占比超65%,北美市场占比22%,欧洲、其他地区占比3%,中国成为全球具身智能资本布局的核心区域。
从整体融资情况看,2025年中国具身智能相关领域融资事件约360起、融资金额超450亿元;截至2026年6月30日,2026上半年融资事件已达322起,融资金额约934.7亿元,新增约20家百亿估值独角兽。

中国2026年上半年部分明星具身智能企业融资情况
3、专利技术情况
截至目前,全球已完成近20万件具身智能技术积累,发明专利占绝对主导,高达89.7%的专利为技术含量与创新门槛更高的发明专利。在过去的20年里,具身智能正由长期技术积累进入技术创新爆发期。2005年全球具身智能相关专利申请量尚不足2000件,而到2025年这一数字已跃升至2.6万件,增长至原来的十余倍,年复合增长率达到15.1%。尤其是2024年以来,具身智能技术创新热度显著抬升,专利申请量从2024年的1.6万件陡增至2025年的2.6万件,单年增幅超过60%,呈现跃升式增长。
在全球范围内,中国已成为具身智能技术创新的主要来源国,贡献了全球过半的相关专利。按原始专利权人所在国统计,来自中国的研发机构共贡献约10.3万件具身智能专利,占全球总量的53.3%,是目前最活跃的具身智能技术来源国。然而,与其他发达技术来源国相比,中国具身智能专利在技术引领力上仍有待验证——尽管中国具身智能专利数量位居全球第一,但其平均被引量仅为1.8件,而其他发达技术来源国的专利平均被引量均在3件以上,美国甚至高达61件。专利平均被引量是指一件专利平均被多少件专利引用,可以作为衡量技术被后续创新借鉴程度的重要指标。专利平均被引量的差距表明,中国虽已形成规模优势,但在技术影响力、技术引领性方面仍需进一步验证。
(二)主要企业竞争情况
1、海外龙头
1)特斯拉
特斯拉Optimus是世界上被视为最具长期竞争力的产品之一,首次公开亮相于2022年10月。公司自研Dojo超级计算机,主要用于训练FSD自动驾驶系统和Optimus人形机器人的神经网络。作为Optimus的超算算力底座,Dojo拥有汽车端数十亿里程视觉数据沉淀,世界模型训练算力储备位居全球第一梯队。此外,公司是唯一同时具备大模型 AI、人形硬件自研、百万级量产制造能力的巨头,车规级供应链、自动化产线能力不仅在制造端为Optimus提供竞争优势,更从场景端为具身智能提供第一批测试场,源源不断提供真实物理交互数据飞轮。
Optimus身高约173cm,重约56kg,接近成年人尺寸,适配人类工位;单只灵巧手拥有22自由度,腱绳传动,电机全部后置前臂,指尖触觉力反馈,可拧螺丝、抓取易碎小件;最高行走速度达1.2m/s,具备抗扰动平衡恢复;最大负载20kg,可搬运汽车零部件、电池包,适配特斯拉自有生产车间工作场景;机体搭载自研4680电池,电池2.3kWh,可连续工作8-10小时,支持自主充电;决策层采用端到端 VLA+世界模型融合路线,感知层利用多目相机、全身IMU、关节传感及指尖力觉传感,无激光雷达,坚持纯视觉路线。目前产品小批量生产价格为5-6万美元,全部用于自有车间进行内测,预计2027年开始进行B端外销,远期量产价格计划在2万美元左右。
2)Figure AI
Figure AI于2022年创立,总部位于加利福尼亚州圣尼维尔,专注通用人形机器人研发。2023年3月,Figure AI首款人形机器人Figure 01正式面世,这款机器人不仅能够完成诸如搬箱子等简单的体力任务,还能通过观察人类的示范动作,自主学会煮咖啡。2025年3月,公司最新一代机器人Figure 03正式推出,已具备执行物流分拣、洗衣、叠衣及摆放碗碟等任务的能力。
Figure 03机器人身高168cm,重约61kg,适配人类工位与家庭环境;单只灵巧手拥有20自由度,集成指尖力触觉传感器、掌内相机,精细抓取操作能力突出,指尖可检测3克微小压力;最高行走速度达1.2m/s,最大负载20kg;机体电池2.3kWh,可连续工作5小时,支持足底无线充电;决策层采用Helix VLA快慢双系统架构+LLM+运动基元融合路线,感知层利用多目相机、全身IMU、关节传感及指尖力觉传感,无激光雷达,视觉路线为主。截至2026年中,公司累计交付数百台Figure 03机器人,以B端试点为主,已拿到宝马付费订单,目前小规模生产成本为单台8-10万美元,未来4年累计出货目标为10万台。

Figure 03机器人可轻松捏起扑克牌
公司整体融资节奏极快:2023年5月完成7000万美元A轮融资,两个月后,再获900万美元A+轮融资,英特尔资本等机构参与;2024年2月,公司完成约6.75亿美元B轮融资,估值达26亿美元,投资方包括微软、英伟达及亚马逊旗下基金;2025年9月,公司完成C轮融资,筹集资金超过10亿美元。融资完成后,公司估值跃升至390亿美元(约合2700亿元人民币),成为目前全球估值最高的人形机器人公司。
3)Agility Robotics
Agility Robotics成立于2015年,是从俄勒冈州立大学拆分出来的机器人公司,总部位于美国俄勒冈科瓦利斯,专注于工业机器人及人形机器人业务。2017年推出的首款双足机器人Cassie创造了双足机器人百米速度最快的吉尼斯世界纪录。2019年,公司推出双足机器人主力型号Digit,其双腿继承Cassie设计,并增加了上半身与手臂部件。2026年8月11日,公司公布最新一代Digit v5机器人,明确于2026年12月完成首批交付。
公司当下主力产品为Digit v4机器人,身高175cm,重约42kg,整体采用轻量化设计。机器人双手为专用物流夹持末端,非通用高自由度灵巧手,整体灵活度不及行业第一梯队水平;最大移动速度1.5 m/s,下肢为反双足结构,具备动态平衡、跌倒自起、四肢着地安全关机协议;因其轻量化的整体设计,可标准满电连续作业16小时,支持自动回充、电池快换,为当前人形机器人中续航领先者;决策层采用VLA+运动基元混合控制架构,感知层集成激光雷达、深度摄像头、IMU等。Digit机器人已累积客户现场工作时间超6.5万小时,获取超3万亿美元仓储物流工厂订单,客户含亚马逊、GXO Logistics等,是全球商业化进展最快的企业。其单机成本约12.5万美元,但公司主要商业模式是RaaS订阅模式,而非整机销售。

Digit机器人已完成仓储物流场景验证
公司已于2026年6月确定通过SPAC合并方式登陆美股,估值约25亿美元,股票代码为AGLT,目前尚未正式挂牌交易。
4)波士顿动力
波士顿动力(Boston Dynamics)是1992年从麻省理工学院腿部实验室剥离而成,主营业务为机器人设计与制造,2026年成为韩国现代汽车全资子公司。公司拥有Spot四足机器人、Stretch轮臂机器人及Atlas人形机器人等不同系列产品。得益于公司超30年的动力学研究积累,公司人形机器人的奔跑、跳跃、摔倒恢复、复杂非平整地面适应能力为行业标杆,自研全身动力学控制器是公司核心壁垒,但其不从事原生VLA、世界模型等大模型研发工作,决策层搭建严重依赖外部合作。
公司主力商业化产品为 Spot机械狗,体重32.5kg,最大负载14kg,续航时间约90分钟,可拓展热成像、气体检测、激光雷达等载荷模块;目前已在工业巡检、油气、矿山、建筑施工进度采集、电力设备、公共安全、应急救援等场景实现落地,目前已累计出货3000台以上,遍布全球35个国家,单机售价约7.5万美元,是公司主要收入来源。
公司人形机器人Atlas目前仍处于内部研发验证阶段,其具身大脑采用Google DeepMind行为大模型,预计2028年开始进入商业化部署阶段。
2、国内竞争主力
1)宇树科技
宇树科技(Unitree Robotics)成立于2016年8月,总部位于浙江省杭州市,专注于民用机器人研发生产。公司已于2026年8月19日上市科创板(688836),最高市值接近4500亿元,2026年8月市值约2200亿元。公司主力产品包含Go系列四足机器人及H1、G1等人形机器人。公司的强项为小脑运动控制,通过自研全身动力学控制器,实现国内顶尖的奔跑、摔倒恢复及复杂地形适应能力,具身大脑采取自研与外部合作并行的模式——自研WVLA2.0 UnifoLM模型属于VLA+WMA世界模型融合路线,同时接入DeepSeek、英伟达GR00T作为备选外脑模型。
公司四足机器人重约32kg,负载重量约14kg,可用于电力、管廊、消防、科研等场景,目前已累计出货3万台以上,单价仅2-3万人民币,海外收入占比超35%,已经形成稳定营收与毛利,现金流可以反哺人形与具身大模型研发;人形机器人中出货主力为G1紧凑型型号,身高约1.62m,以科研院所、高校、展示、教育客户为主,真正工业场景付费试点仍处于早期阶段。公司的核心零部件高度自研,可跨平台复用,成本控制能力较强,有利于未来商业落地的推进。
2)智元机器人
智元机器人(AgiBot)成立于2023年2月,隶属于智元创新 (上海) 科技股份有限公司,总部位于上海,专注于AI与机器人融合的通用人形机器人研发,最新投后估值150亿元。公司2026年已出货智能机器人超8000台,当年出货量暂列全球第一。公司产品涵盖远征系列人形机器人、精灵系列轮臂机器人、酷拓四足机器人等。公司自研启元GO-1/GO-2具身基座大模型(ViLLA架构),采用VLA+LLM+运动基元混合路线,支持一脑多型,可适应目前所有主力具身智能体。
公司目前商业化进程最快的智能体是精灵系列轮臂机器人,可适用于汽车零部件装配、3C工位作业、仓储分拣、商超整理、科研等场景;人形机器人尚无大规模工厂验证案例,仍以科研场景为主。公司采用硬件整机销售、RaaS月租、小时租赁等多种商业模式,2025年全年实现收入10.5亿,成为“国内最快实现10亿营收的机器人公司”,年均复合增速约20倍。2026年一季度,公司营收已超过10亿元,预计全年实现40亿元。

智元机器人已完成15000台机器人量产下线
3)优必选
深圳市优必选科技有限公司(UBTECH)成立于2012年,总部位于深圳市,是一家集人工智能和人形机器人研发、平台软件开发运用及产品销售为一体的全球性高科技创新企业。公司于2023年12月完成港股IPO(09880.HK),最高市值接近700亿元,2026年8月市值约367亿元,是港股人形机器人第一股。公司早期以消费教育、舞台表演机器人为主,2024年开始转型工业具身赛道。公司机器人矩阵包含Walker系列人形机器人、Cruzr系列轮臂式机器人、Alpha系列小型教育人形机器人等。
公司目前主力机器人型号为Walker S2双足人形机器人,身高约176cm,重量约73kg,单臂最大负载约15kg,支持3分钟热插拔自主换电,可实现7*24h工业连续作业。产品搭载自研Thinker基座大模型,属于VLA+世界模型融合路线,已成功于汽车、航空、3C工厂等场景完成搬运、上下料、质检辅助等任务小规模试点。公司2025全年营收超20亿元,全尺寸人形收入约8.2亿元,同比 增幅超2200%;2026上半年总营收12.69 亿元,全尺寸具身人形收入5.9亿元,同比增幅1400%,占总收入 46.5%,正式成为公司第一大收入来源。
4)星动纪元
北京星动纪元科技有限公司(Robot Era),成立于2023年8月,总部位于北京市,专注于具身智能及通用人形机器人研发,致力于通用人工智能的前沿应用研究。根据公开资料显示,公司2026年累计融资接近50亿,估值破百亿,已筹划赴港上市,拟募资8亿至10亿美元。
公司的具身模型技术水平在行业内处于领先地位:2024年12月,公司发布融合世界模型的 VLA 算法框架VPP,打造了全球首个融合世界模型的具身大脑;在2026年3月举办的Benjie's Olympics赛事上,公司凭借其领先的VLA模型,一举斩获了具三项任务的全球第一,为该赛事迄今为止唯一上榜的中国企业。

星动纪元刷新三项世界纪录
公司主力产品为L7全尺寸双足人形机器人,身高171cm,双臂总负载 20kg,搭载自研XHAND1直驱灵巧手,拥有12-15自由度指尖力触觉,可双手协同抓取异形包裹,适用于仓储分拣、工厂上下料、装配等场景。产品搭载自研具身大脑ERA-42属于VLA+世界模型WAM路线,支持一脑多形,可驱动双足、轮式、双臂、灵巧手多种硬件形态。公司大脑模型、运控、本体、灵巧手、数据闭环全部自研,硬件自研率超95%。
在商业化层面,公司是具身智能行业首个完成PMF(产品市场匹配)验证的企业,已与顺丰、中国邮政两大物流标杆企业深度合作,在全国10余个物流中心实现常态化运营。部分机器人在高温、潮湿等恶劣环境下性能接近人类水平,实现24小时不间断作业。2026年第二季度,公司开启千台级机器人批量交付,增速达300%。
5)智平方
智平方(深圳)科技有限公司(AI² Robotics)成立于2023年4月,总部位于深圳,是一家专注于具身智能通用机器人研发的科技企业,技术范式对标特斯拉 Optimus。公司成立至今已完成13轮融资,累计融资规模接近70亿,目前投后估值突破200亿元,成为粤港澳大湾区首家达成200亿估值水平的具身智能企业,已启动港股IPO筹备工作,预计2027年递交材料。
公司主力产品包括AlphaBot 2全尺寸人形机器人和AlphaBot-W轮臂具身智能体。其中AlphaBot 2身高约172cm,单臂最大负载10kg,可连续工作6小时以上,面向汽车、半导体、制药产线上下料、装配、物料转运等作业场景。产品搭载NeuroVLA具身基座,属于VLA+世界模型混合路线。
公司已在深圳自建半自动化整机产线,年产能2000台,已经实现常态化批量交付。公司目前已拿到东风柳汽等车企千台框架订单,用于工厂零部件转运、辅助装配等作业任务,此外还完成了晶圆厂、制药实验室场景的作业试点。
6)星海图
星海图(北京)人工智能科技股份有限公司成立于2023年9月,总部位于北京,专注于具身智能基础模型及机器人本体研发,坚持“整机+智能”全栈自研路线。公司成立不足3年已完成10轮融资,累计融资接近50亿元人民币,最新投后估值突破200亿,目前已完成股份制改革,拟赴港股上市。
公司产品包括Nexo(原R1 Pro)轮臂式机器人和Kengo全尺寸双足人形。其中Nexo机器人是目前公司商业化主力产品,其双臂负载最高20kg,满电续航工作时间约8小时,支持快充、换电、自主回充三种补能模式,可支撑7*24小时连续作业,适用于3C电子操作、工业料箱搬运、仓储物流及商业服务等多种场景。产品搭载自研G0/G0.5VLA 基座模型,属于VLA+WAM世界模型融合路线,实现一脑多形,一套基座模型驱动轮臂、人形多种硬件形态。
目前公司正在北京亦庄建设整机产线,规划产能达万台。Nexo机器人(含原有R1 Pro型号)单价19.9万,已入驻斯坦福、英伟达等海内外百余家AI实验室,海外客户占比较高,已完成工厂场景小规模试点,积累千台在手订单;Kengo 尚处于样机试点中。
免责声明:本文由千山资本整理编辑,仅供交流学习,本文内容不构成任何投资建议或实际的投资结果,亦不保证当中的观点和意见不发生任何调整或变更,投资者不应以该等信息取代其独立判断或根据该等信息做出任何决策。部分内容及图片来源于网络,若侵犯了您的合法权益,请及时与我们联系。



研报速递
发表评论
发表评论: