0

作者丨齐铖湧
编辑丨董子博
8 月的最后一周,国家速滑馆“冰丝带”,第二届世界人形机器人运动会。
朋友圈里刷屏最多的,是田径赛场上机器人百米冲刺、跳远,无论是跑出新纪录,还是电机着火,这些画面都会吸引大量的普通观众。
但AI科技评论问了几位深度参与到这次运动会的具身从业者,专业观众们最关注的比赛是什么,都得到了统一的答案:场景赛。
场景赛现场没有跑道,只有临时搭建的客厅、厨房和货架,进行的是家庭、餐饮、商超三项场景比赛。
业内有一个心照不宣的共识:场景赛≠竞技表演,是机器人真实工作能力大考。田径项目考的是运动控制算法,只要算力足够,一套动作在仿真环境里跑上几万遍,总能算出最优解;
但场景赛考的是具身大模型,包含“大脑”和“小脑”,环境是动态的,物品是柔软的,随时会有人来打断你的工作,对模型泛化能力的要求,完全不在一个量级。
这届比赛,还有一个不太被外行注意,但在圈内引发热议的规则:允许遥操。
尽管遥操遭到行业内外各种鄙视,但在这种顶级大会上依旧允许遥操,那是因为想要做到全自主,门槛实在太高了。但AI科技评论仔细阅读了一下这次的积分规则,有一个发现:按照规则,明摆着组委会是鼓励全自主。(积分规则:自主模式成绩权重是 1.0,遥操模式直接打五折,仅为 0.5;同分时自主队伍排名靠前。)
但据AI科技评论观察,这次比赛中,多数队伍依然选择遥操规避风险。
为什么大家会选择分数比重更低的遥操?因为在真实的物理世界里,让 AI 100% 掌管一具沉重的钢铁躯体,风险太大了。一位比赛中的具身大厂选手告诉AI科技评论:“0.5 的折扣虽然疼,但总比机器人当场死机、或者把厨房砸了要强。”。
在这样的背景下,场景赛中家庭、餐饮、商超三个场景的夺冠者,却是一个完全自主不遥操的团队:银河通用。

某种意义上,在家庭、餐饮、商超这三个流程最长、最容易翻车的项目,银河通用不仅坚持三项全部全自主,不依赖任何人工后台干预,并且完全交由其自研银河星脑(AstraBrain)世界动作模型独立完成决策与执行。
在家庭场景中,做到了30 分钟量级全场最长赛程且提前完赛。商超项目上,直接把金、银、铜牌全拿了。
最终的成绩单是夺冠率 100%,包揽三大赛项金牌。
我们深度了解了一下,这三块全自主金牌背后的“技术难点”。(雷峰网)

01
藏在家庭、餐饮、商超场景的
三个底层具身难题
一位深度参与比赛项目的人士告诉我们,如果把这三场比赛拆开来看,会发现它们恰好对应了当下机器人学术界和工业界最头疼的三个底层难题。
首先是家庭考场,它比的是机器人对抗“误差级联”与“记忆断片”的能力。
家庭场景是三个项目里任务链最长的一个。机器人要在客厅、卧室、卫生间、阳台之间来回穿梭:捡起杂物、把钱包放到指定位置,接着要自主开门、把脏衣服塞进洗衣机、叠衣服,最后用衣架把衣服晾起来。
第一个是柔性物体操作。以叠衣服为例,传统的工业机器人抓取杯子很容易,因为杯子是刚体,具有固定的 6 个自由度(x/y/z及三个旋转轴),用几何运动学就能算出来。但衣服是软的,它有“无限自由度”,每一次抓起来褶皱都不一样。这意味着靠写死轨迹的代码彻底失效了,机器人必须依赖端到端的视觉-动作模型,实时观察布料的形变,实时调整双手的发力。
第二个考点,是长程任务中的“随机干扰与记忆恢复”。这也是整场比赛最惊艳的一幕。
当机器人正准备执行下一项任务时,现场突然响起一条随机的语音指令:“有快递送达门外,请尽快取进屋内。”
这在 AI 术语里叫“分布外(OOD)事件”。
机器人必须立刻理解这句自然语言,暂停手头的活,走到门口把快递拿进来。最难的是:拿完快递后,它还得记得刚才干到哪一步了,并回到原位继续工作。
对人类来说,洗碗时去开个门,回来接着洗是本能。但对具身智能来说,这涉及到复杂的“时空接地”和长短期记忆调度。在物理移动的过程中,机器人的视野已经完全改变。一旦大模型的“上下文窗口”出现物理状态的断层,机器人就会像失忆一样僵在原地。这就是长程任务中最可怕的“误差级联”,前面的微小偏差或中断,会导致后续任务全线崩溃。
这个比赛整整 30 分钟,是本届运动会赛程最长的一个项目,对物理机器人来说,这相当于一场马拉松:时间越长,机械漂移、感知噪声、电量波动带来的不确定性就越容易被放大。

而在激烈的角逐中,由 AstraBrain 驱动的银河通用机器人不仅顺利完成了所有干扰项,还在赛后的技术复核中,首次复核即满分,证明了这绝非偶然的运气,而是底层模型实打实的泛化能力。
其次是餐饮考场,它考察的是机器人挑战莫拉维克悖论与“力控”噩梦的能力。
餐饮场景的流程,要求机器人听懂指令,从热食柜里用食品夹取出餐品,放进微波炉,拧动定时旋钮,加热完取出,最后接杯饮料平稳送达。
这个场景,可以说是“莫拉维克悖论”的完美体现,对人类越简单的动作,对 AI 越难。
最典型的就是使用工具(夹子)和拧微波炉旋钮。
人类的手指自带极其敏锐的触觉反馈。但机器人夹食物时,食品夹是不固定在手上的,这等于要求大模型把本体的感知“延伸”到了工具的末端。夹轻了,餐品半路掉落;夹重了,直接把食物捏烂。
而“拧旋钮”则考验着行业内极难做好的柔顺控制。你不能只是在三维空间里给机器人下达一个 (X,Y,Z) 的坐标指令,如果是刚性位置控制,机器人手指只要稍微偏离一毫米,就会把微波炉的塑料旋钮生生掰断。
它必须学会像人一样,带着一种“弹簧般”的柔性去触碰,感受到阻尼的反馈,再输出扭矩。
在这一系列充满变数的操作中,多数队伍为了不搞砸,选择用遥控器接管精细动作。银河通用依然坚持全自主,最终以 6 分 55 秒的成绩零失误最快完赛。
这说明,AstraBrain 不仅在做高层的逻辑推理,也已经深度穿透到了底层的力矩输出。

最后是商超考场,考点是抛弃“过拟合”,进入开放世界。
商超场景是一场 20 分钟的限时高压测试。任务是:按外卖订单拣货,巡查货架,给空缺的位置补货,并把被乱放的商品归位。
在这个考场里,“背地图”是毫无意义的。订单是动态的,缺货位置是随机的,错放的商品五花八门,甚至货架上还故意摆放了外观相似的干扰项。
在传统机器人开发中,开发者往往会为了某个特定场景反复写规则、调参数,这被称为“过拟合(Overfitting)”,出了这个实验室的门,代码就废了。但在商超赛场上,机器人面对的是一个迷你的“开放世界”。
比如抓取袋装薯片,包装袋反光、形状不规则,传统视觉算法很难提取边缘特征,极易抓空。但银河通用机器人凭借多模态大模型的实时感知,精准识别并丝滑抓取,甚至能够自主发现哪里的商品摆错了,并将其纠正。
最终,在这个对动态环境实时判断要求极高的赛道,银河通用直接包揽金银铜牌。

02
文章写到这里,懂行的人可能会提出一个非常尖锐的问题:即使全自主夺冠,这会不会依然是一套为了比赛专门训练的“特化模型”?
事实上,很多机器人公司在比赛中大放异彩,但在真实商业落地时却举步维艰,就是因为赛场上的“高光表现”无法低成本地复制到千万个不同的现实场景中。
但银河通用的表现,并不需要“特化调参”,答案藏在数据流向里。他们在赛场上的游刃有余,其实是日常高强度工作带来的“降维打击”。
在零售领域,银河通用打造的“银河太空舱”,全球首创完全由人形机器人自主运营的零售店,目前已进入全国近 50 城、约 200 个点位,且稳定运行超过一年。
不久前,美国 Fox News知名主播 Bret Baier 专程探访了一家由银河通用机器人运营的全家超市。

在毫无清场、人流穿梭的真实商业环境中,Baier 目睹了机器人在上万种不断变化的 SKU 中,自主完成商品识别、货架巡查、判断缺货并补货的全流程。
而这,还不是他们最硬核的数据。
在更强调严谨与容错率的医疗场景,银河通用依托银河星脑,联合合作伙伴打造了近百个智慧药房。其中首家落成于 2024 年 9 月,迄今已经在不到 50 平米的密集排布空间里,7×24 小时不间断运行近两年,累计出药超百万。

100 万次是什么概念?在赛场上,机器人只需要把这套流程做对一次就能拿金牌;但在药房里,它面临的是几十万次的重复、磨损、光线变化、包装更迭,这要求系统必须具备极高的鲁棒性。每一次在真实世界遇到罕见的长尾问题,都会化作高质量的微调数据,反哺回大模型中。
这百万次药房出药、近 50 城零售店的日常售卖,产生的不是流水账,而是海量带物理反馈的真实数据。这些交互数据持续回流到 AstraBrain 中,构成了一个“真实应用—数据回流—模型进化”的闭环。赛场上的随机干扰、动态订单,对已经见过无数真实长尾场景的模型来说,不过是日常训练的子集。

03
运动会终将落幕,但透过这三块全自主金牌,一个关乎行业走向的清晰趋势已经浮出水面。
过去几年,人形机器人的战火集中在“身体”上。电机扭矩有多大?执行器有多精密?有没有灵巧手?但随着供应链的成熟,硬件正在快速走向同质化。大家逐渐意识到,给机器人一副好躯壳,就像给了一台顶配的电脑,如果没有操作系统,它依然只是一堆昂贵的废铁。
接下来,人形机器人竞争的核心,已经不可逆转地转向了具身智能大脑。
这也正是银河通用能够包揽三金的最底层逻辑。他们没有为某一项特定的任务去写几万行 if-else 代码,而是将底座押注在自研的银河星脑(AstraBrain)世界动作模型上。
什么是世界动作模型?简单来说,如果你给文本大模型(如 ChatGPT)输入前半句话,它会预测下一个词;如果你给 AstraBrain 输入当前视角的视频流和物理状态,它能在脑海中“模拟”出整个物理世界的运行规律,并直接预测出下一步应该输出给各个关节的扭矩和动作。
网球场上的实时拦截,家庭里的防干扰,微波炉前的精细力控,商超里的动态决策……不同的身体、不同的考卷,背后其实是同一个在不断理解物理规律的“大脑”。
银河通用创始人兼 CTO 王鹤博士曾提出一个极具前瞻性的论断:具身智能正在不断接近属于自己的“ChatGPT 时刻”。
这个时刻的标志,不是机器人背会了 1000 种人类预设的动作,而是它们开始具备了真正的泛化能力。人类不再需要懂编程,只需要用自然语言,甚至只展示几遍动作,机器人就能举一反三,在从未见过的新环境里完成新任务。
银河通用本次成绩印证了通用具身大模型的惊人落地潜力。全自主模式下 100% 的夺冠率,就像是这个大时代来临前的一声长鸣,它向世界宣告,物理世界的智能觉醒,已经有了明确的解法。
不同的身体、不同的场景、不同的任务背后,是同一套不断进化的具身智能通用能力。(雷峰网(公众号:雷峰网))
雷峰网原创文章,未经授权禁止转载。详情见转载须知。