全球「AI学术顶会」精华汇聚地
您正在使用IE低版浏览器,为了您的雷峰网账号安全和更好的产品体验,强烈建议使用更快更安全的浏览器
此为临时链接,仅用于文章预览,将在时失效
人工智能学术 正文
发私信给丛末
发送

0

李飞飞、吴佳俊再联手,打破世界模型和机器人动作的「巴别塔」

本文作者: 丛末   2026-09-01 10:56
导语:视觉轨迹充当“同声传译”,让世界模型和机器人动作真正“同频对话”。
李飞飞、吴佳俊再联手,打破世界模型和机器人动作的「巴别塔」
视觉轨迹充当“同声传译”,让世界模型和机器人动作真正“同频对话”。

    作者丨幸丽娟

    编辑丨岑   峰

                                                                                                       

日前,一篇叫做《TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks》的论文悄然上线 arXiv。论文署名中出现了两个大家很熟悉的名字——李飞飞、吴佳俊。

李飞飞、吴佳俊再联手,打破世界模型和机器人动作的「巴别塔」

论文链接:https://arxiv.org/html/2608.24101v1

熟悉具身智能圈的人都知道,这两个名字放在一起,分量不轻。

李飞飞是世界模型“空间智能”方向的旗帜人物,而刚刚领完 IJCAI 2026 计算机与思想奖的吴佳俊,则是这一领域最核心的研究者之一。

这两位长期合作的学术战友,最近在具身智能领域动作频频。就在一个月前,他们刚与 ControlNet 作者张吕敏等十余位学者共同发表了《Masked Visual Actions for Unified World Modeling》,把机器人动作渲染成像素轨迹,喂给视频世界模型。

但对于他们而言,之前的尝试或许还不够彻底。

世界模型能看懂机器人动作了,但机器人动作那一侧的问题还卡着:动作怎么实时变成轨迹?世界模型预演完,怎么反过来帮机器人挑动作?

这条往返的路,还没有打通。

这一次,他们直指这个问题的核心:机器人的“动作控制”和世界模型的“预测画面”,说的根本不是同一种语言。

TrAct 的解法,就是在中间配一位“同声传译”。

李飞飞、吴佳俊再联手,打破世界模型和机器人动作的「巴别塔」

01

  世界模型的“巴别塔”:

动作和像素,鸡同鸭讲

先解释一下背景。

现在具身智能行业正在形成一种共识:光靠 VLA“条件反射”式地输出动作不够,得让机器人学会“先在脑子里过一遍”——多个候选动作,交给世界模型预演未来,再挑结果最好的执行。

π0.5、GR00T 这些头部 VLA 模型,在标准基准上已经刷到接近满分。但在真实世界的泛化中,它们依然频频翻车。

因此,世界模型的“预演”能力,被普遍认为是具身智能的下一个关键拼图。

但问题是,“预演”这出戏,主演对不上台词。

机器人控制器输出的是一串低维的“动作方言”:可能是末端位姿,可能是关节角,可能是夹爪开合,也可能三者组合——十几或二十个低维数字。

世界模型需要输出的是高维的“像素画面”:夹爪在画面中的像素坐标、轮廓形状、与物体的距离;面条在每一帧中如何弯曲、滑动、与碗壁碰撞。每一帧可能是 224×224×3 ≈ 15 万像素,16 帧就是 240 万像素。

问题来了:20 个数字怎么推导出 240 万个像素?

从“末端位姿变化 0.02 米”到“夹爪在画面中向右移动了 50 个像素”,中间隔着一整条物理因果链——关节转动、末端接触、物体滑动、相机成像。把前者直接喂给后者,等于给导演看剧本大纲里的 20 个关键词,让他脑补出两个小时的电影。

世界模型就是在硬着头皮干这个"脑补"的活儿。 论文将这种方案称为 AWM(Action-conditioned World Model,动作条件世界模型) ——给定动作指令,直接预测未来画面。

不意外的是,这套"硬猜硬译"的方案,翻车姿势非常典型:

夹爪姿态预测错了;背景和目标物体在预测画面里凭空消失;两个相机视角对同一物体的位置判断互相打架。

更要命的是,每一种机器人的“动作方言”都不一样。 Franka 说 Franka 语(末端位姿+夹爪开合),UR5 说 UR5 语(另一套关节参数),双臂机器人又说第三套。

同样是“把面条放进碗里”,每台机器人“念出来的台词”完全不同。

也就是说,换一台机器人,之前学的"动作到画面"的映射几乎作废——跨本体泛化,就成了行业公认的死结。

一边是机器人执行不了的像素,一边是世界模型看不懂的动作。

TrAct 的答案:请一位“同声传译”,把两边的话翻译成彼此都懂的语言。

这位“同声传译”,叫做视觉轨迹(visual track)。

李飞飞、吴佳俊再联手,打破世界模型和机器人动作的「巴别塔」

02

TrAct :让视觉轨迹当“同声传译”

视觉轨迹是什么?一句话:具身无关而任务相关的关键点,在图像坐标里随时间移动的路径。

TrAct 会跟踪两类点:

1.夹爪点:机械臂夹爪上的 7 个固定网格顶点,覆盖夹爪的轮廓和运动范围——解决“手怎么动”;

2.场景点:图像平面上 5×5 均匀网格采样的 25 个点,分散在整个画面——解决“环境怎么动”(物体滑动、相机晃动)。

这两类点的分工很明确: 夹爪点是“主动运动”的源头,直接反映机器人的动作意图;网格点是“被动运动”的参照,帮助模型判断画面变化是来自夹爪移动、物体滑动,还是镜头晃动。两者结合,世界模型才能准确理解“哪些像素动、为什么动”。

这套语言妙就妙在“通用”:不管 Franka、UR5 还是人手,把物体放进碗里这个动作,翻译成轨迹都是同一句话——“夹爪关键点沿这条路径移动,物体从当前位置进入碗的区域”。动作带着本体特异性,轨迹却是跨本体的“普通话”。

李飞飞、吴佳俊再联手,打破世界模型和机器人动作的「巴别塔」

围绕这个接口,TrAct 搭了一个“剧组”,三个阶段、三个组别分工明确:

VLAT(Vision-Language-Action-and-Track model),出方案的导演组。

在预训练 flow-matching VLA π0.5 的基础上改造动作头,让它同时输出动作块对应的轨迹块。

  • 动作块 a是“方言”——末端位姿、关节角、夹爪开合,这些低维的机器人指令;

  • 轨迹块 τ 是“普通话”——任务相关关键点在图像坐标系中的运动路径。

两者必须严格成对: 每一组候选方案里,动作和轨迹来自同一次策略采样,不能拆开自由组合。这是贯穿全文的一条红线——预演条件是轨迹,执行控制是动作,两者必须对应同一套方案。如果轨迹描绘出一个美好的未来,配对的执行动作却实现不了这条轨迹,预演就成了“自我感动”。

训练时,VLAT同时优化两个流匹配损失:动作损失监督“方言怎么说”,保证指令可执行;轨迹损失监督“普通话怎么写”,保证轨迹准确描述了画面里点的运动轨迹。换句话说,导演组既要把戏排出来(动作),又要把分镜画清楚(轨迹),两条线同时推进。

TWM(Track-conditioned World Model),预演的拍摄组。

分镜画好了,谁来把它变成成片画面?拍摄组上场。

TWM以 Stable Video Diffusion(SVD)为视频生成骨干,增加了一个 Temporal ControlNet 分支,专门把轨迹坐标渲染成空间控制图。智能体视角(agent-view)的轨迹走红色通道,腕部视角(wrist-view)走蓝色通道——两个视角共享时间线,各自保留独立的“机位”。

有了轨迹这个普通话版的“分镜脚本”,世界模型的工作方式彻底变了:

之前(AWM)是“给一串方言,硬猜画面”:给定末端位姿变化0.02米,模型得自己脑补“这会导致夹爪在画面中向右移动50个像素、同时把面条推出去、碗的遮挡关系发生变化……”——整条物理因果链全靠硬猜。

现在(TWM)是“给一段普通话,按脚本渲染画面”:已知关键点从A位置移动到B位置、物体从P点滑到Q点,把对应的像素生成出来就行。

从“因果推理”变成了“条件渲染”,难度降了一个维度。 拍摄组不需要理解“关节转了30度会怎样”,只需要按照分镜把画面拍出来。

VLAC(Vision-Language Reward Model),拍板的审片人。

画面拍出来了,谁来定稿?审片人。

VLAC基于 InternVL2 的视觉语言奖励模型,对每条预演视频按任务指令打分。但它评的不是“画质清不清晰”,而是“任务完成了没有”——面条进碗了吗?夹爪够到目标了吗?关柜门关严了吗?

审片人只看剧情对不对得上剧本。哪怕样片画质有点糊,只要动作做对了,VLAC就给高分;反之,画面再逼真、动作跑偏了,照样不及格。

李飞飞、吴佳俊再联手,打破世界模型和机器人动作的「巴别塔」

推理时,三个角色是这么协作的:

1.导演组出方案:每个决策点,VLAT用TSR(Temperature-Scaled Resampling,温度缩放重采样) 生成K个候选动作-轨迹对(仿真K=20,真机K=16)。

2.拍摄组拍画面:TWM拿着每个候选方案里的轨迹,逐一生成预演视频。

3.审片人打分:VLAC对每条预演视频按任务指令打分,选出得分最高的那一条。

4.执行:把那条高分样片对应的动作交给机器人执行。

选中的永远是同一对(a,τ)——预演条件与执行控制来自同一次策略采样。“想得到”(轨迹预演)和“做得到”(动作执行)被绑定,减少中间的信息传递失真。

李飞飞、吴佳俊再联手,打破世界模型和机器人动作的「巴别塔」

03

数据引擎:没有动作标签的

人类视频,也能“重用”

这套接口的另一重红利,来自于数据侧。

机器人数据贵得离谱,而互联网上人类第一视角操作视频近乎无限——但人类视频没有机器人动作标注,传统 VLA 拿它们没什么办法。

轨迹接口绕开了这堵墙:人类视频虽然给不了“机器人这段方言怎么说”,但完全能给得出“这段画面的分镜脚本长什么样”。

于是 TrAct 的预训练配方是:76K 条 DROID 机器人遥操作数据 + 约 150K 条 EgoDex 人类第一视角操作视频(约占完整 EgoDex 的一半),按 1:2 混合。

DROID 的夹爪 7 点、EgoDex 每只手 7 点加 25 个背景网格点,全部统一映射进同一套轨迹槽位布局——缺失的相机、操控器和轨迹槽位全部用掩码处理。

这意味着什么?人类视频终于不用“翻译成动作”,就能直接参与机器人模型的预训练。

背后的逻辑很清楚:视觉运动是可以跨具身共享的监督信号,而且这个信号的供给几乎是无限的。 人类视频的量级,是机器人遥操作数据永远追不上的。这就让 TrAct 在预训练阶段获得了远超纯机器人数据的运动先验。

数据规模和跨具身通用性,两者在这个接口下被同时激活了。

李飞飞、吴佳俊再联手,打破世界模型和机器人动作的「巴别塔」

04

更严酷的考场,

更硬核的物理测试

仿真基准:LIBERO-INTEGRAL 上全面领先

先说基准。标准 LIBERO 上,各家模型的表现已经接近天花板——π0.5 平均 96.8%,TrAct 98.3%,差距不到 2 个点,说明刷榜刷不出区分度。

李飞飞、吴佳俊再联手,打破世界模型和机器人动作的「巴别塔」

于是团队自建了一个更严酷的考场——LIBERO-INTEGRAL,共 20 个任务:

  • 10 个鲁棒性任务:涵盖物体互换(Swap)、物体变化(Object)、任务变化(Task)、相机视角变化(Camera)、机器人初始位姿变化(RobotInit),各 2 个,全部取 LIBERO-Plus 最难档位;

  • 10 个跨具身任务:把场景里的 Franka Panda 直接换成 UR5,任务规范和场景配置保持不变。

“考生”包括四种策略变体:

  • π0.5:基线 VLA 策略

  • VLAT:联合预测视觉轨迹和可执行动作,无动作选择

  • TrAct:完整框架,包含轨迹条件世界模型动作选择

  • VLAT+AWM:用动作条件替代轨迹条件

李飞飞、吴佳俊再联手,打破世界模型和机器人动作的「巴别塔」

换到 LIBERO-INTEGRAL这个考场,差距瞬间拉开

• π0.5 平均成功率 27%,其中任务变化 15%、跨本体 17%——“换任务”、“换机器人”恰好是其表现最惨的两项,而这正是机器人动作执行的痛点所在;

•  VLAT(加轨迹头但不做预演)平均成功率是 44%;

• VLAT+AWM(用动作条件世界模型做预演)平均成功率是 49%;

• TrAct 拿下 55%的成功率,比 π0.5 翻了一倍还多,比同样做预演的动作条件版本再高 6 个点。

逐类别看,TrAct 在 Swap 65%、Object 60%、Task 50%、Camera 60%、RobotInit 65%、跨本体 50%,六项全部领先;20 个任务里 18 个拿到最佳或并列最佳。

李飞飞、吴佳俊再联手,打破世界模型和机器人动作的「巴别塔」

跨本体任务的细节更能说明问题:

UR5 版“把橙汁放进篮子”,π0.5 成功率 0.0,TrAct 拉到50%;

“把碗放到盘子上”,π0.5 成功率 40%,TrAct 拉到 80%。

当然也有翻车的——“拿番茄酱进篮子”,π0.5 是 0.0,TrAct 也只有 10%。团队没有回避这一点:难任务依然难。

李飞飞、吴佳俊再联手,打破世界模型和机器人动作的「巴别塔」

统计显著性也做了确认:三种随机种子的评估中,TrAct 平均 0.547(95% 置信区间 [0.53, 0.56]),VLAT+AWM 平均 0.490([0.47, 0.51]),两个置信区间完全不重叠——改进是真实的,不是抽签抽出来的

视频预演质量:有“分镜”的,碾压没“分镜”的

再看世界模型的视频预演质量本身。论文比较了 TWM(轨迹条件,有分镜) 与 AWM(动作条件,没分镜)在仿真和真实两个场景、智能体和腕部两个视角下,在五个标准视频质量指标上的表现:

PSNR:峰值信噪比,越高越好;

SSIM:结构相似性指数,越高越好;

LPIPS:学习感知图像块相似度,越低越好;

FID:弗雷歇起始距离,越低越好;

FVD:弗雷歇视频距离,越低越好;

李飞飞、吴佳俊再联手,打破世界模型和机器人动作的「巴别塔」

结果,轨迹条件(TWM)对动作条件(AWM)是全指标碾压。

差距最悬殊的是仿真 + 智能体视角这一配置:TWM 比 AWM, PSNR 高出 62%,SSIM 高出 75%,LPIPS 低了 76%, FID 低37%,FVD 低 70%。

真实世界腕部视角同样悬殊:TWM 比 AWM,PSNR高出 22% ;SSIM 高出 19% ;LPIPS  低 40% ;FID 从 176 降至 130,低 26% ;FVD 低 43% 。

两个场景、两个视角、五个指标,TWM 无一例外全部领先。

也就是说,有“分镜”的比没“分镜”的预演画面,质量高出一个维度。把“动作方言”翻译成“轨迹普通话”再预演,比从动作指令硬猜画面,准得多。

更硬核的物理机器人实验:继续遥遥领先

仿真里的成功还不够。团队把 TrAct 搬到了真实的 Franka Panda 机器人上,看看它在物理世界里到底扛不扛得住。

机器人配备了两个 RGB 相机——一个从第三方视角看着整个桌面,一个装在夹爪上近距离盯着操作区域。训练数据只有 400 条 15Hz 的演示,覆盖了 4 个基础任务;测试则是 5 个训练时从没见过的任务:

1.将半长粉色面条放入碗中;

2.将热狗面包放入碗中;

3.将绿色砖块放入碗中;

4.关闭部分打开的右柜门;

5.将倾斜勺中的意大利面倒入锅中。

每个任务 10 个 episode,而且不仅要过常规背景这一关,还要在换了桌面背景的陌生环境下再跑一遍——看看它会不会被“换了个桌布”就搞懵。

李飞飞、吴佳俊再联手,打破世界模型和机器人动作的「巴别塔」

最终平均成功率:π0.5 是 49%,加上 VLAC 评委直接打分是 65%,VLAT+AWM 是 66%,TrAct 是 76%。

两个任务的细节值得单独拎出来说。

李飞飞、吴佳俊再联手,打破世界模型和机器人动作的「巴别塔」

一个是关右边的柜门”——五个任务里唯一接触密集型的,最能拷打预演精度。

常规背景下,π0.5 只有 50%,VLAT+AWM 也才 60%,TrAct 做到 80%;

换到陌生背景下,动作条件版本直接掉到40%,TrAct 反而稳在 70%。

这就说明,域偏移越大,轨迹接口的优势越明显。因为轨迹描述的是"画面里该怎么动",天然不依赖具体背景长什么样。

另一个是“半根粉色面条放进碗里”,TrAct 在常规背景下拿到了满分。机器臂夹着一段训练时没见过的、更短的面条,稳稳放进碗里。泛化能力,同样肉眼可见。

更大规模的预训练变体 TrAct+(76K DROID + 60K BridgeData V2 + 完整 30 万级 EgoDex,8 块 H100 跑 60K 步),也把五个最难的 UR5 任务从 π0.5 的 6%、TrAct 的 32% 进一步拉升到 38%。

李飞飞、吴佳俊再联手,打破世界模型和机器人动作的「巴别塔」

这也进一步论证了,接口红利之外,数据规模红利依然在兑现。

李飞飞、吴佳俊再联手,打破世界模型和机器人动作的「巴别塔」

05

TrAct 对具身智能行业的意义

回过头来看,TrAct 真正的贡献,并不在于它刷新了 SOTA,而是“接口层”的统一:

以前,动作是世界模型的输入。你给 Franka 语它就学 Franka,给 UR5 语它就学 UR5——换台机器人,推倒重来。

现在,机器人动作和世界模型预测之间有了统一的翻译层。机器人输出动作(方言),轨迹把它翻译成“画面里的点怎么动”(普通话),世界模型拿着翻译结果做预测。

机器人动作和世界模型“鸡同鸭讲”的行业困局,第一次得到系统性的破局。

但硬币的另一面同样清晰,论文自己也交代得明白:

第一,TrAct 不是物理模拟器。轨迹是二维图像空间的点运动,不显式建模力、碰撞和接触状态;它预测的是"看起来会发生什么",不保证“物理上一定发生什么”。

第二,预演的可靠性最终依赖 VLAT 的轨迹预测质量。如果动作本身不可靠,轨迹和动作可能一起错,高分预演不等于安全执行。

第三,它不便宜,每个决策点要跑十几次视频生成和打分,推理成本是真金白银。雷峰网雷峰网(公众号:雷峰网)雷峰网

第四,真机数据也还是少了点:400 条演示,5 个评测任务,离工业级场景的验证还有距离。

在整个行业都在苦寻大模型如何驱动机器人的当下,大家都在问同一个根本问题:世界模型和机器人之间,到底该用什么语言对话。

TrAct 交出了一份极具启发性的答卷。它证明了,肉眼可见的视觉轨迹,可以成为这一通用的语言。

IJCAI 2026 要来了,你还在单打独斗?

为了方便大家抱团交流、互通会议消息,我们专门建了 IJCAI 2026 参会群!进群你会解锁这些「福利」?

  • 会议情报站投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航场馆分布、报告厅怎么走,群里随时问;

    议题共读热门 session、Keynote 现场探讨,错过也能追;

    Poster 汇编现场海报精华整理,一键收藏不遗漏;

    约局广场约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

? 进群传送门: 扫码进群或添加微信Qvv0909777,备注:IJCAI + 单位/学校+姓名+方向

李飞飞、吴佳俊再联手,打破世界模型和机器人动作的「巴别塔」

搞科研/搞技术,信息差很重要。

来,一起快人一步!

李飞飞、吴佳俊再联手,打破世界模型和机器人动作的「巴别塔」

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

李飞飞、吴佳俊再联手,打破世界模型和机器人动作的「巴别塔」

扫描上方二维码

或点击阅读原文关注专区。

雷峰网原创文章,未经授权禁止转载。详情见转载须知

李飞飞、吴佳俊再联手,打破世界模型和机器人动作的「巴别塔」

分享:
相关文章
最新文章
请填写申请人资料
姓名
电话
邮箱
微信号
作品链接
个人简介
为了您的账户安全,请验证邮箱
您的邮箱还未验证,完成可获20积分哟!
请验证您的邮箱
立即验证
完善账号信息
您的账号已经绑定,现在您可以设置密码以方便用邮箱登录
立即设置 以后再说