联系我们
主办单位

中国工业合作协会

上海市工业经济联合会

上海市经济团体联合会

承办单位

中国工业合作协会绿色工业节能分会

工信装备工程研究院(北京)有限公司

上海贝瑞克展览有限公司

联系我们
参展指南
人形机器人靠什么"像人"——拆解感知-决策-执行的具身智能链条
发布时间:2026-08-24        浏览次数:1001        来源:上海机器人展

人形机器人靠什么"像人"——拆解感知-决策-执行的具身智能链条


如果让你闭上眼睛,仅凭手感把桌上的水杯递到对方面前,你大概不会失败。但对一台机器人来说,这个看似简单的动作背后,是一场精密到毫秒的"系统工程":它要先"看见"杯子在哪儿,再"想清楚"怎么走过去、伸手、握紧又不捏碎,最后驱动几十个关节协调发力——任何一环掉链子,杯子就会摔在地上。


这正是"具身智能"(Embodied Intelligence)想解决的问题:让智能不只是在屏幕里算题,而是长进身体里,能感知、能思考、能行动。今天许多人形机器人之所以能站起来、走稳路、做点简单家务,靠的正是感知、决策、执行三段链条的协同。本文试着把这台"钢铁之躯"拆开,看看它究竟靠什么越来越像人。


1.jpg


一、运动控制:机器人的"肌肉与小脑"


人能稳稳走路,靠的是肌肉骨骼提供动力、小脑实时调节平衡。人形机器人的"肌肉骨骼",就是关节执行器。


一台人形机器人身上通常有数十个自由度(关节),分布在腰、髋、膝、踝、肩、肘、腕。要让这些关节像人的肌肉一样既有力又柔顺,核心部件是执行器——它把电机的高速旋转,通过减速器变成关节处的大扭矩、低速转动。行业常用的"旋转执行器"方案,会把电机、减速器、驱动器、编码器紧凑地塞进关节腔内,追求单位体积下更大的扭矩(即"高扭矩密度")。通俗讲,就是让机器人的"肌肉"更结实、也更轻。


而让机器人"不摔跤"的,是类似小脑的实时控制系统。双足行走本质是个"动态平衡"难题:身体重心始终在脚底支撑范围的边缘试探,稍有不慎就会倒。机器人需要不停读取 IMU(惯性测量单元)等传感器,结合模型预测控制(MPC)等算法,在毫秒级内算出"下一时刻各关节该用多大力",才能完成迈步、转身、抗扰动。这也是为什么早期人形机器人走起路来像踩高跷,而新一代产品已经能小跑、能上下斜坡——平衡控制能力,是"像人"的第一道门槛。


二、多模态感知:机器人的"眼耳鼻舌身"


光会动还不够。人靠眼耳鼻舌身认识世界,机器人也要有一套"感官"。


视觉是最主要的一路。通过摄像头、深度相机,机器人能"看"到环境的三维结构,识别物体、判断距离。但光"看见"不够,更关键的是"看懂"——把像素变成语义,知道哪是桌子、哪是杯子、哪是路。


触觉和力觉,则是机器人"手感"的来源。在指尖嵌入触觉传感器(俗称"电子皮肤"),机器人能感知接触的位置和轻重;在手腕、脚踝装上六维力传感器,它能知道抓握时用了多大劲。这就是为什么理想情况下机器人能稳稳拿起一颗生鸡蛋而不捏破——力觉闭环告诉它"再用力就碎了,收一收"。没有这套反馈,机器人要么抓不牢,要么一抓就坏。


把视觉、触觉、力觉等多路信息融合起来,机器人对世界的理解才从"平面图"变成"可交互的立体场景"。这就好比人闭着眼靠手感也能辨物,多模态互为补充,才能应付真实、杂乱、充满意外的环境。


2.jpg


三、决策大脑:从"听懂指令"到"自主规划"


感知解决了"知道世界什么样",执行解决了"身体能动作",中间最关键的是大脑——它决定"下一步该干什么"。


过去的人形机器人,多半靠工程师提前写好的脚本:走到 A 点、抬起手臂、按下按钮。这就像只能照菜谱做菜,换个灶台就傻眼。而今天,大模型(尤其是视觉-语言-动作模型,VLA)正在把具身智能推向新形态:你用自然语言说"把桌上的红杯子拿给我",模型能把这句话、眼前的画面、可执行的动作连起来,自动拆解出"走到桌边—识别红杯—伸手抓取—转身递送"的序列。


更进一步,先进系统开始具备"任务规划"和"常识推理"能力:杯子被挡住了,它会先挪开前面的书;地面有水,它会绕行。这种从"听懂一句指令"到"为达成目标自主规划多步动作"的跨越,是具身智能眼下最受关注的进展之一。需要提醒的是,这类能力高度依赖海量训练数据,业内普遍采用"仿真训练+真实微调"(Sim2Real),结合模仿学习与强化学习来打磨,距离真正"通用"仍有不短的距离。


四、技术路线之争:端到端,还是模块化?


链条这么长,行业一个重要分歧是:这三段该"装进一个黑箱里",还是"分成几段各管各的"?


模块化(也称分层式)路线,把感知、决策、控制拆成清晰的三层,每层独立研发、各司其职。好处是可解释、好调试:哪一步出错能精准定位,也便于不同团队分工。缺点是层与层之间要传递"接口",信息难免损耗,面对全新场景时灵活性受限。


端到端路线则相反:直接把"摄像头画面等原始感知"喂进去,模型一把输出"关节该用的力"。它更依赖数据、潜力上限更高,理论上能学到人类写不出的精妙策略。但代价是像个黑箱——一旦出错很难解释原因,且对数据量和算力要求极高。


现实里,大多数团队并非二选一,而是在"完全端到端"和"完全手工分层"之间找平衡,采用混合架构:关键的安全环节保留可解释模块,感知到动作的高层映射交给数据驱动模型。这条路线之争,短期内不会停。


去现场看"会动的大脑"


3.jpg


把感知、决策、执行三段串起来,人形机器人"像人"的密码其实并不神秘——它是一套工程上的协作:灵敏的感官、聪明的大脑、听话又稳健的身体。每一项技术的突破,都在把"钢铁"往"伙伴"拉近一步。


如果你想知道这些链条如今走到了哪一步、各家整机和技术有什么新花样,不妨关注 HRIE 2026 人形机器人与智能装备展(2026 年 12 月 9–11 日,上海·国家会展中心 SNIEC)。届时将有相关整机产品,以及核心零部件、感知与决策方案的集中展示,是近距离观察"具身智能"落地的好机会。