中国工业合作协会
上海市工业经济联合会
上海市经济团体联合会
中国工业合作协会绿色工业节能分会
工信装备工程研究院(北京)有限公司
上海贝瑞克展览有限公司
今年8月的 WRC 2026 世界机器人大会上,一个微妙的变化被不少人忽略了:展馆里,企业们不再热衷于让机器人现场翻跟头、走猫步,比谁跳得更高、跑得更快。大家围在屏幕前,比的是谁的模型更聪明——能不能听懂一句模糊的指令,能不能在没见过的环境里自己想出办法。
这背后是一条清晰的行业分水岭:当本体硬件逐渐趋同、量产成本一路下探,"躯壳"本身正在快速失去壁垒。真正的战争,已经上移到了"大脑"。
过去两年,人形机器人最吸睛的是"身体":双足平衡、灵巧手、关节自由度。但到了2026年,硬件正在变成 commodity(大宗商品)——电机、减速器、传感器供应链日趋成熟,主流本体的运动能力差距快速收敛。
换句话说,能跑能跳已不再是稀缺能力。据行业观察,固定场景下,经过针对性数据喂养的机器人任务成功率已接近百分之百;可一旦对象换一个、灯光调一档,成功率便骤降。决定机器人能不能"走出演示视频、走进真实世界"的,不再是腿和手,而是那颗"脑子"——能不能理解、能不能推理、能不能泛化。
据 WRC 大会披露的趋势,2025年行业主流方案还是 VLA(视觉-语言-动作模型),即"看见—听懂—行动"的端到端映射;而2026年,几乎所有头部玩家都在 VLA 之上叠加了一样新东西:世界模型(World Model)。

什么是世界模型?一个好懂的类比:就像下棋高手落子前,会在脑子里推演接下来几步的局面演化。世界模型让机器人在真正执行动作之前,先"预演"环境会怎么变——杯子被碰到会往哪滚、人走过来会挡住哪条路——从而提前修正动作、减少误差累积。
据 WRC 2026(8月20日北京)呈现的清晰趋势,这条"VLA + 世界模型"的技术路线已成为头部共识。具体打法各有千秋:
银河通用 AstraBrain WAM 0.5,把 VLA 与世界模型统一进同一套架构(World-Action Model);同期推出的 WBC 0.5 面向全身实时运动控制,据公司发布,已验证出类似 GPT 的 Scaling Law 与零样本泛化能力。
星动纪元 ERA-42 采用"慢思考、快执行"双系统,引入世界模型预测未来状态。
智源研究院"悟界·RoboBrain Orca"以"预测下一个物理状态"来构建具身大脑。
北京人形机器人创新中心 Pelican-Unify 集成 VLM+Action+WFM 三重能力,打通"理解—推理—预演—执行"闭环;其 Pelican-VL 2.0 据称为国内首个通过网信办备案的具身大模型。
星海图 G0.5 把视觉、语言、动作全部离散为 Token,像 GPT 一样自回归输出,并计划8月底推出 Max 开源版。
章鱼动力 SYNWorld 则押注 10B+ 参数的世界基础模型,训练数据累计已超过30万小时。
路线之争之外,工程范式也在收敛。据 WRC 大会观察,"快慢脑"已成为行业共识:大脑负责深度推理与任务规划(慢系统),小脑负责高频运动控制与即时响应(快系统)。星动纪元、北京人形机器人创新中心等的架构,本质上都在落实这种"高层规划与低层控制分离"。
另一条主线是"跨本体"。过去是"一种本体配一套模型",训练成本高、复用难。如今据媒体报道,银河通用的轮式、重载、双足三种形态已能跑同一套具身基础大模型;星海图 G0.5 通过统一动作编码适配不同本体;深诣提出"一脑多形",试图彻底摆脱"一机一脑"。蚂蚁灵波 LingBot-VLA 2.0 更把预训练融入6万小时真实物理数据,覆盖17个品牌、20种构型,实现"一脑多机"——据公司发布,它已在上海国大药房上岗,承担夜班药品分拣。
但说到根上,架构只是表象,数据才是真正的燃料。智平方莫磊在行业分享中直言:"干活"才是能力进化的天花板,需要软件、硬件、场景三位一体,大脑与本体协同进化。
据媒体报道,京东将开放物流、零售、健康等真实场景,两年目标积累千万小时级的高多样、强标注数据,构建"数据飞轮"。新的采集工具也在涌现:觅蜂 MEgo 系列"无本体采集"整机仅560克、毫米级定位,一人即可独立完成全场景采集,已量产交付;光轮智能发布了号称全球首个十万小时级全模态人类开源数据集 EgoSuite-Open100K。
但飞轮也有卡点:sim-to-real gap(仿真到现实的迁移损失)。据技术共识,纯靠仿真训练的机器人在物理世界里性能会显著衰减——虚拟环境的"手感"和真实世界的摩擦、光照、扰动终究不同。这也是为什么各家都在抢真实场景、抢"干活"的数据:只有让机器人在真实世界里干够多活,那颗"脑子"才真的会进化。
回到最被关心的问题。宇树科技王兴兴在 WRC 主论坛发言时表示,全球具身智能当前最大瓶颈是泛化能力不足——固定场景喂数据后成功率接近100%,但换对象或微调环境便骤降。他给出了一个可感知的"里程碑"判断:当机器人能在任意陌生环境里稳定完成约八成任务时,就是"具身智能的 ChatGPT 时刻"。他预测,这一刻最快2-3年、最慢5-10年到来。
这个判断值得玩味:它把"战争终点"从"谁硬件强"重新定义成了"谁的数据飞轮转得更快、谁的世界模型更会想"。
技术的路线之争还在继续,但方向已经清晰——人形机器人的下半场,比的不是谁的身体更灵活,而是谁的"大脑"更聪明、谁的数据飞轮转得更稳。
如果你也想亲眼看看这场"大脑之战"的真实战况,不妨把目光投向年底的这场行业盛会。2026年12月9-11日,HRIE 2026上海国际人形机器人与机器人全产业链展览会将在上海国家会展中心(SNIEC)举行。届时,从整机本体到具身大模型、从世界模型演示到一脑多机的现场调度,都将在同一个展馆里同台亮相。对于想看懂人形机器人下一步往哪走的人,HRIE 2026 值得专程走一趟。