跳到主内容
MK体育官方网站

看懂银河通用,就读懂了具身智能的未来

2026-08-19 · 周海燕

具身智能的ChatGPT时刻,究竟应该怎样定义?

8月19日,世界机器人大会(WRC)现场,在由银河通用主办的「具身智能大模型的进化之路」分论坛上,银河通用创始人兼CTO王鹤把这个问题抛给了现场。

他的答案是,机器人面对没有专门学习过的常见技能,也能实现零样本泛化;普通用户无需算法背景,就能教会它新的动作。实现这一点,人形机器人需要一颗能够理解物理世界、控制全身和双手,并且持续学习的大脑。

在银河通用最新发布的小人形机器人Galbot ET1(“银河星仔”)上,这套设想拥有了一副新的身体。据介绍,“银河星仔”是全球首款具备自主学习能力的智能体人形机器人。它搭载由银河通用自研的AstraBrain-Agent,可以实时观察环境,理解人类指令,并动态规划行为。人类无需准备动作视频,便能通过互动教它学习新的动作技能。

“银河星仔”灵动的身体背后,是其具身大模型——银河星脑AstraBrain的一次最新进化。当具身智能行业仍围绕身体性能展开激烈竞赛,银河通用已经把更重的筹码押在具身大模型上。而这个模型,也正在决定机器人的上限。

这也是银河通用成为本届WRC最受关注的公司的原因。

当Agent进入物理世界

“银河星仔”之所以引起讨论,在于它承载了一种新的产品逻辑。

过去两年,Agent已经成为AI行业最热门的概念之一。数字世界里的Agent可以在软件之间调用工具,帮助用户查找资料,也可以替人执行线上任务。物理智能体面对的是持续变化的现实环境。无论是物品形状的变化,还是光线和位置的改变,都需要让模型迅速理解,再驱动身体作出反应。

银河通用将AstraBrain-Agent定义为“物理世界原生智能体”。它的感知和规划直接面向现实空间,思考的结果最终要变成身体动作。机器人执行动作后,环境随之改变,新的反馈又会影响下一步判断。

“银河星仔”的互动自学习能力正是在这套逻辑下产生。它能够实时识别人类舞者的运动轨迹,跟随对方完成街舞动作。面对撑地和倒立等高难度动作,它依然能够保持身体稳定。这种灵动的身体表现,正是来自银河星脑通用小脑AstraBrain-WBC的支持。

这套模型背后有超过10万小时的人类动作数据。一部分来自高精度动作捕捉,另一部分则由互联网人类视频转换而来。借助这些数据,模型能够学习人类如何维持平衡、协调关节和完成连贯动作,再将运动能力迁移到机器人身上,无需提前写好整套动作轨迹。

这背后是具身大模型技术的进化。过去,机器人增加一项技能,通常需要专业团队重新采集数据并完成训练,技能也容易与特定本体和场景绑定。AstraBrain-Agent则希望保留模型已经获得的通用能力,再借助少量互动适应新任务。机器人每学会一项新技能,都在持续扩充同一颗大脑。

围绕银河星脑,银河通用构建了包含大脑、脑桥和小脑的全脑架构。大脑负责理解环境并规划行动,小脑负责控制全身及双手,脑桥将高层意图传递到具体动作中。

其中,大脑采用银河通用率先提出的世界—动作模型WAM架构。VLA能够根据视觉和语言生成动作,世界模型擅长推演环境将如何变化。WAM把两种能力纳入统一模型,让机器人理解一个动作可能带来的物理结果,并据此决定下一步行为。

AstraBrain WAM的核心突破,是把跨本体、跨场景和多任务能力收进同一套基模。同一颗大脑可以驱动G1机器人使用灵巧手在商超取货,也能完成叠衣服等柔性操作;更换机器人本体后,它还可以执行全新搬箱任务。模型积累摆脱了硬件和场景的限制,这种广泛的能力迁移在行业中尚属首次。

“银河星仔”还搭载了由银河通用自研的AstraBrain-WBC 通用小脑基模。它基于大规模人类运动数据训练,可以把AstraBrain-Agent生成的意图转化为稳定、连贯的身体动作。模型面对训练中没有出现过的动作时,也具备出色的泛化能力。

网球是最能检验这套技术能力的场景之一,这项运动具有很强的对抗性,留给机器人的反应时间极短。它既要预测来球轨迹,还要及时调整站位,更要在保持平衡的同时精准击球。而“银河星仔”搭载了银河通用LATENT高动态网球对抗规控框架,在实际演示中已经能够根据真人来球实时调整动作,完成拟人化对打。

从跟随人类,再到独立判断,产业逐渐形成了一种新共识:一台人形机器人能够达到怎样的上限,越来越取决于它背后的“脑”还能长出多少新能力。而它进入的身体越多,它在物理世界中积累的经验就越丰富,下一台机器人也会因此拥有更高的起点。

一颗大脑的真实测验

在银河通用的展位上,这颗“银河星脑”也被放进了不同的任务中接受检验。

最有现场感的是一项看起来寻常的早餐任务:机器人需要连续完成取面包、倒水和摆盘等步骤。执行过程中时常有偶发状况,例如杯子被观众拿走,或者目标物体突然被遮挡。但在现场演示中,机器人会根据眼前的新状态重新规划,自如地完成剩余工作。

传统机器人在固定环境中执行预设流程,只要某一步的条件发生改变,整项任务就容易中断,真实世界却很少严格遵守预先写好的剧本。一个人在桌边伸手,一只杯子被临时移开,都会改变机器人下一秒应该做什么。

长程任务的难点就藏在这些临时变化里。动作持续得越久,前面产生的误差越容易影响后续步骤。机器人需要在执行过程中不断更新对环境的理解,同时保持对整项任务的记忆。

另一个高难度场景是叠衣服,这很考验具身大模型对柔性物体的理解。衣物并没有固定形态,机器人每抓取一次,布料的褶皱都会改变。模型需要重新判断衣服当前的状态,寻找合适的抓取点。任务能否继续,取决于模型能否在每一步操作后更新判断。

当然,对真实的产业场景而言,一次演示成功还远远不够。每天大量重复作业中的准确率,才决定客户是否愿意持续为机器人买单。

银河通用是最有资格回答这个问题的具身厂商。这家公司已经将产品规模化应用于智慧药房和即时零售。机器人需要在上万种商品中准确找到目标,完成抓取后交给骑手。这样的任务每天会重复大量次数,准确率、运行稳定性和异常处理能力直接影响业务。

而在工业场景中,银河通用的Galbot S1双臂最大负载达到50公斤,能够承担重型物料搬运。负载增加后,机器人需要重新调整身体姿态和出力方式,还要判断周围人员的位置,确保协作安全。

不同场景使用的机器人形态不同,面对的问题也相差很大。一边是柔软易变形的衣服,一边是密集货架,另一边则是工业重物。它们共享银河星脑的技术底座,也验证了银河星脑的泛化能力。而这,这正是具身大模型具备通用性的起点。

对于银河通用而言,模型进入产业还有另一层价值。智慧药房、即时零售和工业产线会持续产生真实数据。这些数据记录了仿真环境难以覆盖的问题,例如包装材质的变化、设备长期运行产生的偏差,以及现场人员带来的随机干扰。模型经过新一轮训练后,更新的能力又会回到机器人身上。

在论坛上,银河通用还宣布将向科技企业和产业伙伴开放仿真平台、数据采集设备、具身基模及强化学习后训练管线。普通开发者也可以围绕“银河星仔”创造新的动作和应用。这也是具身大模型走向通用的必经之路:当生态变得越开放,参与者越多,大模型接触的真实问题越丰富,模型的进化速度也会随之加快。

模型只有进入真实世界,技术成果才会转化为能够持续生长的生产力。银河通用在本届WRC证明,银河星脑已经拥有这样的能力。

具身大模型才是新的分水岭

过去几年,人形机器人行业的聚光灯大多照在身体上。

在机器人运控和工程能力上表现突出的宇树科技,8月19日的上市首秀就是一个例证。开盘当天,宇树科技便拿下超过629%的涨幅,市值一度达到4449亿元。资本市场用一场极为热烈的首秀,为人形机器人本体的商业价值给出了高价。

机器人跑得快、跳得高,承受巨大冲击,的确是技术进展最直观的尺度。但当机器人进入药房、商超和工厂,一台“能动”的机器人显然已经无法满足需求。它要理解一句含义模糊的指令,处理训练中没有见过的物体,还要应对人员走动和物品移位。身体决定机器人能够到达哪些地方,大脑则决定了它的能力边界。

具身大模型因而成为行业新的分水岭。

本体性能可以通过供应链和工程投入加快提升,一颗通用大脑的成长周期则往往更长。它需要在大量任务中学习物理规律,并进入真实场景接受检验。当模型经历的任务越丰富,处理新问题时可以调用的经验也会越来越多。后来者即使采用相近的硬件,也很难迅速补上这种know-how。

宇树上市彰显了机器人身体的商业价值,具身大模型的竞争则正在定义行业下一阶段的能力坐标。

银河通用很早就将数据基础设施视为具身大模型的核心。为此,银河星数构建了一座五层数据金字塔。其中,互联网数据帮助模型理解语义,人类动作数据提供操作经验,仿真平台可以大规模生成训练样本,真机遥操作数据负责校准精细动作。而在机器人进入实际场景后,工作中产生的问题又会回到训练体系。

王鹤在论坛上披露,银河通用已经积累100万小时人类数据,以及8万小时真实场景回流数据。早在2021年,团队便开始建设第一视角人类—物体交互数据集。如今,数据采集设备、仿真平台和模型测评系统已经被接入同一套基础设施。

当更多机器人进入真实场景,银河星脑能够获得更丰富的物理经验;模型能力得到提升后,新机器人和新任务的适配成本也会下降。部署规模与模型能力相互推动,构成不断生长的数据飞轮。

再回到本届WRC讨论度最高的问题:具身智能的ChatGPT时刻,究竟什么时候到来?

王鹤给出的标准是,机器人面对人类无需专门学习的常见技能,能够实现零样本泛化,成功率达到70%至80%;普通用户也可以低成本完成后训练,让模型快速适应自己的工作环境。这时,具身智能才真正拥有类似ChatGPT的普及基础。

模型能力达到七八成只是第一步。现实中的客户仍然需要算法工程师采集机器人动作数据,再完成标注和调试。高昂的适配成本会把机器人挡在大量中小企业和普通用户门外。具身大模型想要普及,还要解决“谁都能教、谁都能用”的问题。

王鹤在本次论坛演讲中还介绍了WAM-TTT测试时训练方案。用户佩戴第一视角相机,拍摄自己完成工作的过程,模型便能利用无标签视频进行部署,无需重新采集机器人动作数据。

这又把具身智能的通用化向前推进了一步。统一基模负责积累物理世界的通用知识,人类只需展示自己的工作,机器人便有机会快速获得对应能力。当教授机器人的过程足够简单,具身大模型才能真正进入千行百业。

在论坛演讲结尾,王鹤描绘了一个更远的产业图景:未来的机器人可能拥有接近手机的出货规模,保持汽车级别的产品价值,同时继承大模型持续升级的能力。一套模型完成进化,无数机器人都能获得能力提升。这种由软件带来的规模收益,将打开一个万亿级市场。

人类用了数十年为数字世界积累语言和图像,物理世界的训练语料仍要由机器人亲自书写。它们会在药房里辨认上万种商品,在工厂里处理意外,也会在普通人的示范中学会一项新工作。每一次真实行动,都会成为下一次进化的起点。

当同一颗大脑能够进入不同身体,当教会机器人一项技能变得像教人一样自然,具身智能的ChatGPT时刻才会真正到来。一颗能够在万千身体中共享经验、持续进化的大脑,将让AI真正进入物理世界,也为具身AGI打开现实入口。

更多文章