AI与机器人的关系:从“造身”到“赋魂”
AI与机器人的关系:从“造身”到“赋魂”
2026年8月,北京亦庄,世界机器人大会的展馆内,一台名为Galbot ET1的双足人形机器人正在学习打网球。它不仅能自主维持身体平衡、精准控制腕部动作,还能通过左右吊球等战术与人类选手展开对抗 。支撑这一切的,是银河通用自研的具身大模型“银河星脑”与物理世界原生智能体AstraBrain-Agent的深度协同 。
这一幕,恰如其分地揭示了AI与机器人关系的本质跃迁:机器人不再是预设程序的冰冷执行者,AI也不再是困于数字世界的“缸中之脑”。两者的深度融合,正催生出一个全新的智能物种——具身智能。
从“身体”到“大脑”:一场竞赛重心的转移
过去十年,机器人竞赛的核心是“身体”:谁能走得更稳、跑得更快、关节更灵活。而今,行业重心正在发生根本性转移。高盛在2026年7月发布的研究报告明确指出,行业焦点已从“身体能力”转向“智能决策” 。在具身智能的产业链中,“大脑”的溢价已远高于“身体”。正如一位机器人产业投资人所言:“国内机器人硬件产业链已无代际差距,核心差距在‘大脑’。具身智能的投资逻辑正从押注机器人本体转向押注具身大脑。”
这一判断最直观的体现,来自蚂蚁灵波科技在WRC上的展示。其“全栈大脑2.0”驱动的机器人,能在药房、工厂、仓库三种截然不同的场景中连续作业,并且这套大脑在预训练阶段就适配了17个机器人品牌、20多种构型,可实现单臂、双臂、双足、轮式,以及头部、腰部、灵巧手等多自由度的协同控制 。同一种大脑,驱动不同形态的“身体”,完成截然不同的任务——这正是“一脑多机”的产业图景。
“大脑”的进化:VLA模型与世界模型
机器人“大脑”的技术路线正日益清晰。当前,两条主流的“大脑”路线正在并行演进:视觉—语言—行动模型(VLA)与世界模型 。
VLA模型赋予机器人将传感器信息与自然语言指令直接转化为实际动作的能力,它吸收了海量带动作标签的机器人数据,让机器学会“怎么做” 。而世界模型,则被图灵奖得主杨立昆定义为“能预测行动后果的内部模拟器” ,是机器人认知物理世界、预判行动后果的核心引擎。它消化海量视频数据,让机器理解“世界是怎样的”。
银河通用提出的世界—动作模型(WAM)架构,正是试图将这两种能力纳入统一模型,实现跨本体、跨任务、跨场景的操作能力 。而宇树科技则更进一步,正在预研物理AI机器人自进化体系:让智能体自主检索全球前沿论文、生成控制代码,在仿真与实物测试中完成闭环迭代,最终实现机器人的自我进化 。
落地的考验:泛化、数据与场景
尽管“大脑”的技术路径日渐清晰,但行业共识是:具身智能尚未迎来它的“ChatGPT时刻”。宇树科技董事长王兴兴直言,当前机器人的最大瓶颈是泛化能力不足——在固定场景中,任务成功率可接近100%,但一旦操作物品或环境发生变化,成功率便大幅下滑 。
根本原因在于误差累积:语言模型的输入输出处于数字向量空间,几乎无误差;但机器人的每一次感知、决策与执行都会产生误差,末端操作的毫米级偏差最终会导致任务失败 。这解释了为什么世界模型在2026年成为行业焦点——它试图在行动之前,先在内部推演多种可能、预判不同后果,以减少物理世界中的试错成本 。
然而,实验室与展台上的突破,最终必须走向真实场景。从蚂蚁灵波在上海国大药房正式上岗的夜班分拣机器人 ,到银河通用已在宁德时代产线常态化运行的工业机器人 ,再到源络科技与国家级科研实验室联合研发、在实验台上完成亚毫米级精准操作的实验室机器人 ——真正的产业价值,正在于AI与机器人结合后,在真实世界中解决问题的能力。
当一台机器人能在80%的陌生环境中,通过自然语言指令完成80%的日常任务时,具身智能的“ChatGPT时刻”便会到来 。这场从“造身”到“赋魂”的跨越,或许就在2至3年内发生 。而它将开启的,不仅是机器人的新时代,更是AI真正理解物理世界、与人类共存共融的新纪元。
下一篇 >>
网友留言(0条)