全球「AI学术顶会」精华汇聚地
您正在使用IE低版浏览器,为了您的雷峰网账号安全和更好的产品体验,强烈建议使用更快更安全的浏览器
此为临时链接,仅用于文章预览,将在时失效
人工智能 正文
发私信给郑佳美
发送

0

大晓联合香港大学发布StreamPI,让 VLA 真正理解时间,迈向连续物理智能

本文作者: 郑佳美   2026-08-28 15:17
导语:VLA 开始真正理解时间

 当 VLA 模型理解语言、感知环境并直接生成机器人动作,一个更基础的问题开始浮现:机器人如何理解一个持续变化的物理世界?物体从哪里移动而来、杯子此前遮住了什么、机械臂正在接近还是远离目标——真正决定下一步动作的信息,往往不只存在于当前一帧,而存在于连续的时间之中。

近日,大晓机器人联合香港大学发布全新的连续物理智能研究成果 StreamPI(Streaming Multimodal Temporal Modeling for Vision-Language-Action Models),直指 VLA 长期存在的“单帧智能”瓶颈,为其补上关键的“时间维度”。不同于传统 VLA 主要依据当前观测独立决策,StreamPI 为模型建立持续的多模态时序上下文,使机器人能够记住过去、理解状态变化、判断任务进程,并利用跨帧信息增强精细空间感知与动作决策。它推动 VLA 从“识别当前状态”,进一步走向“理解一个正在发生的物理过程”。

更重要的是,StreamPI 并未依赖额外参数堆叠换取时序能力,而是基于现有 VLA 骨干,通过指令持续锚定、历史信息流式缓存与随机时间间隔训练,实现从单帧决策到连续时序建模的轻量化扩展。真实机器人以及 LIBERO、CALVIN 等实验均显示,StreamPI 在时序记忆、精细空间操作与长程连续任务中取得显著提升。StreamPI 所探索的不只是“让 VLA 多看几帧”,而是让机器人开始同时理解空间、时间与状态演化,为具身基础模型从面向单一时刻的瞬时动作智能迈向真正面向动态世界的连续物理智能提供新的技术路径。

VLA 会“看”和“做”,但还需理解“发生了什么”

π0、π0.5 为代表的新一代 VLA,正不断拓展机器人在开放环境中的泛化边界。π0.5 已能够在训练未见过的家庭环境中完成厨房、卧室清洁等 10-15 分钟的长程多阶段任务,机器人基础模型正在从单一技能执行走向更复杂的开放世界操作。

大晓联合香港大学发布StreamPI,让 VLA 真正理解时间,迈向连续物理智能

基于 VLA 的机器人操作三种范式对比。

 但 StreamPI 直指 VLA 更底层的能力缺口:当前大量模型仍依赖单帧决策,能够判断“眼前是什么”,却难以持续理解“此前发生了什么”。缺少历史上下文,不仅限制机器人的时序记忆,也使其难以利用运动视差、状态变化等跨帧线索形成更准确的三维空间判断。这也是当前流式感知与实时 VLA 研究持续关注的问题。

一个最直观的例子是“猜杯子”:物体被藏入杯子并经过多次交换后,答案已不存在于最后一帧,而存在于整个变化过程;面对滚动物体,单帧只能判断“它在哪里”,连续观测才能理解“它正往哪里去”。当关键信息存在于时间之中,机器人需要的不只是看见当下,更要理解过程。

不是简单“多看几帧”,而是从窗口式走向流式

给 VLA 加入时间信息,最直接的方法是把过去多帧图像组成一个窗口,一次性交给模型。但历史越长,视觉信息越多,不仅需要反复计算已经处理过的画面,推理开销持续增加,任务指令也更容易被大量视觉信息稀释,导致机器人在长程执行中逐渐“忘记目标”。

StreamPI 没有简单堆叠历史帧,而是将每个时刻组织为一个完整的“视觉观测 + 任务指令”时序单元。语言指令持续绑定每一次观测,成为贯穿任务始终的语义锚点,让机器人在不断接收新信息的同时,始终明确“正在做什么、目标是什么”。

在每个时序单元内部,视觉与语言充分交互;不同时间单元之间,则按照时间顺序持续读取和聚合历史信息。由此,模型既能理解“这一刻看到了什么”,也能追溯“此前发生了什么”,将原本离散的单帧判断连接成连续的时序理解,实现帧内解决“这一刻看到了什么”,帧间解决“此前发生了什么”。

记住过去,但不必反复计算过去

让机器人拥有记忆,并不意味着每次决策都要重算全部历史。StreamPI 采用流式推理(Streaming Inference):首帧观测被编码后存入键值缓存,后续只需处理新到来的信息,并直接调用历史表示,避免重复计算整个观测窗口。

大晓联合香港大学发布StreamPI,让 VLA 真正理解时间,迈向连续物理智能

StreamPI 架构示意图

随着机器人持续行动,新信息不断写入、历史信息持续保留,当前决策始终建立在此前状态之上。与此同时,StreamPI 无需额外引入视频编码器或独立记忆模块,而是通过重构原有 VLA 的注意力机制,直接继承 π0.5 的视觉—语言表征能力,在不增加额外模型参数的情况下,让单帧 VLA 获得连续时序能力。

让模型适应真实世界“不整齐”的时间

真实机器人并不会按照理想的固定节奏运行。相机采集、模型推理、通信与机械臂执行都会产生延迟,使真实观测呈现不同程度的时间波动,而只在固定间隔数据上训练的模型,很容易在部署时遭遇时序分布差异。

为此,StreamPI 引入随机时间间隔训练(Random-Interval Streaming Training):随机改变历史观测之间的时间距离,并随机隐藏部分早期信息,让模型适应不同时间跨度和不完整上下文。模型由此学习更稳定的时序关系,而不是依赖特定帧率下的运动模式。

实验显示,在 LIBERO 上,这一策略将三帧输入时的平均成功率从 96.4% 提升至 97.5%,五帧输入时从 97.0% 提升至 98.3%。更大的采样间隔也意味着无需处理相机产生的每一帧,为机器人动作执行留出更多时间;优势在长程任务中进一步放大,其中最依赖长程上下文的 LIBERO-Long,从 π0.5 的 92.4% 提升至 95.0%。在已经接近饱和的高基线上,时序建模依然带来稳定增益。

更考验连续任务能力的 CALVIN 上,StreamPI 平均连续任务长度达到 4.547,超过 π0.5 的 4.313 和 MemoryVLA 的 4.090;任务推进到第五步时,成功率仍达到 85.0%,高于 π0.5 的 79.5%。

真机验证:当“时间”真正改变动作结果

团队进一步设计四项真机任务,分别检验时序记忆与精细空间感知,每项任务采集 100 条人类遥操作示范。在需要持续记住杯子交换轨迹的“猜杯子”(Shell Game)任务中,StreamPI 将 π0.5 的成功率从 46.7% 提升至 80.0%;在需要判断物体运动趋势的滚动物体抓取中,则从 26.7% 提升至 63.3%。差距不在于机器人能否“看见”杯子和瓶子,而在于它能否理解此前发生了什么,以及物体接下来可能去哪里。

大晓联合香港大学发布StreamPI,让 VLA 真正理解时间,迈向连续物理智能

真实世界任务可视化与真实机器人性能对比。

 在强调空间精度的任务中,效果同样明显。在窄瓶口插笔任务中,成功率从 40.0% 提升至 66.7%;纸杯插入杯套任务则从 60.0% 提升至 92.0%。连续观测带来的运动视差、相对位移和状态变化,让机器人获得单帧图像难以提供的几何线索——时间不仅带来记忆,也在帮助机器人更准确地理解空间。

从空间智能,走向时空智能

StreamPI 真正探索的,并不只是“为 VLA 增加历史信息”,而是推动机器人从基于当前状态决策,走向基于连续过程决策:现实世界不再是一组彼此孤立的静态画面,而是一条可以被记忆、理解和持续更新的时间流。

目前,StreamPI 在超长时间跨度训练和极端异步场景下仍有进一步提升空间。未来,团队将探索超过 100 帧的高效时序训练与自适应缓存裁剪,将机器人的时序理解进一步延伸至更长、更复杂的真实任务。

空间告诉机器人“物体在哪里”,时间告诉机器人“世界正在发生什么”。从看见一个瞬间,到理解一段过程;从感知当前状态,到记住过去、理解变化并持续行动——StreamPI 正在为 VLA 补上时间维度,推动具身基础模型从空间智能进一步走向真正面向动态物理世界的时空智能。

关于大晓机器人(ACE ROBOTICS)——让机器人拥有聪明的“大脑”和有趣的“灵魂”

大晓机器人(ACE ROBOTICS)是加速具身智能智慧跃迁的机器人公司,由商汤科技联合创始人、执行董事王晓刚出任董事长,世界级AI科学家陶大程院士担任首席科学家,公司汇聚全球稀缺的青年AI科学家及来自产业界的卓越专家,共同深耕具身智能领域,旨在通过突破性技术创新,对具身智能场景的深刻洞察,推动机器人自主理解和探索物理世界,加速具身智能的商业化场景落地。

大晓机器人首创ACE研发范式,构建“环境式数据采集—开悟世界模型3.0—泛化具身模组”的全链路技术体系。大晓机器人以全时空多视角环境采集为引擎,国内首个开源且已实现商业应用的“开悟”世界模型3.0(Kairos 3.0)和具身基模型为技术基座,解决具身智能行业目前面临的数据荒、常识差、泛化难、通用性不足等核心挑战。大晓机器人同步重磅推出“具身超级大脑模组A1”,加速具身智能在安防、巡检、服务等多元场景的规模化、商业化落地。

大晓机器人不仅是技术的开拓者,更是生态的共建者。大晓机器人通过与顶尖的芯片厂商、硬件厂商、云服务商及垂直场景伙伴的战略合作,共同打通“模型—硬件—场景”的产业闭环,提供标准化与定制化结合的解决方案,共同成为具身智能领域极具潜力的中国创新力量。

大晓联合香港大学发布StreamPI,让 VLA 真正理解时间,迈向连续物理智能

分享:
相关文章
最新文章
请填写申请人资料
姓名
电话
邮箱
微信号
作品链接
个人简介
为了您的账户安全,请验证邮箱
您的邮箱还未验证,完成可获20积分哟!
请验证您的邮箱
立即验证
完善账号信息
您的账号已经绑定,现在您可以设置密码以方便用邮箱登录
立即设置 以后再说