清华联合伯克利提出连续世界模型,机器人不用再逐帧猜环境
创始人
2026-08-15 19:28:35
0

  炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!

(来源:DeepTech深科技)

在具身智能的演进中,世界模型被寄予厚望:它不仅要生成未来画面,更要帮助机器人理解世界如何连续变化。然而,当前主流的视频生成与部分机器人世界模型,它们的底层架构大多仍受制于一个固有的思维定式:离散的下一步预测(Discrete Next-step Prediction)。

简单来说,这种模式将连续的物理世界切分成了一帧帧静态的画面。AI 预测未来时,必须像翻连环画一样,根据当前帧去推演下一帧。这种方式在短时间的视觉生成上大放异彩,但面对长视距的物理任务时,却暴露出明显缺陷:由于误差会逐帧累积,时间一长,AI 就容易偏离原本的物理规律,产生不合逻辑的幻觉。

近日,清华大学智能产业研究院(AIR)与加州大学伯克利分校(BAIR)团队合作提出了一种全新的预测范式 ODEWorld,其建立在连续的“物理时间流”(Physical-Time Flow, PT-Flow)之上。与传统方法直接预测下一帧是什么不同,ODEWorld 试图学习的是:世界究竟怎样从当前状态连续地变化到未来状态。

图 | 连续世界模型概念(来源:受访者提供)

实验中,当研究人员把模型预测出的连续中间状态用于指导机器人后,四项真机任务的平均成功率从 55% 提高到了 80%。

谈起这项研究的出发点,论文共同一作刘东岫告诉 DeepTech,“真实世界是连续变化的,机器人要理解世界怎样运动,其中速度是一个很重要的变量。看到一个物体运动,我们既要知道它往哪个方向走,也要知道它运动得有多快。传统的离散帧世界模型很难直接表达这些信息。”

世界模型,究竟是在“理解”还是“模拟”世界?

在讨论这项成果之前,我们需要先回答一个更基本的问题:今天被统称为“世界模型”的技术,究竟在做什么?

视频生成、三维世界建模、通过预测未来帮助机器人决策,以及让机器人进入虚拟环境训练,这些不同方向如今都可能被称为世界模型。但刘东岫认为,它们实际上可以进一步拆成两类目标:理解世界和模拟世界。

所谓“模拟”,是尽可能准确地复现真实环境。如果要让机器人进入一个虚拟世界进行大规模训练和测试,场景、物体以及各种视觉细节都需要足够逼真。在这条路线上,世界模型更像一个高仿真的模拟器。

“理解”解决的则是另一类问题。机器人看到一段人的操作视频,需要知道其中发生了什么;进入一个场景,需要识别物体在哪里、它们之间是什么关系,以及这些状态正在怎样变化,再把这些信息交给下游动作模型。

两者对模型提出的要求并不相同。模拟追求尽量还原现实,而理解并不要求保留每一个像素。相反,大量背景、纹理和视觉细节对于机器人当前的动作可能并不重要,模型需要把复杂视觉信息压缩下来,留下真正与状态和变化相关的部分。

“理解这件事情,本质上需要压缩。”他说,“我们希望找到一种更加自然、更接近本质的世界表征,再用这个表征指导机器人执行动作。”

按照这一划分,ODEWorld 更接近“理解”这条路线。对团队而言,问题不仅是把视觉信息压缩得更小,更重要的是:压缩之后,究竟应该保留什么。

他们认为,其中一个关键就是世界的动态变化。机器人不仅要知道场景里有什么、物体在哪里,还要理解物体正在怎样运动,以及这些状态如何随时间发生变化。

但现有视觉世界模型通常沿用视频本身的离散形式,根据当前帧预测下一帧。问题在于,视频虽然是一帧帧记录的,真实世界却始终连续变化。摄像头拍下的只是一个个时间切片,两帧之间,机械臂仍在移动,物体的位置、方向和速度也在不断变化。

因此,在刘东岫看来,仅仅压缩视觉信息还不够,模型还需要把这种连续变化本身表示出来。“传统的一些世界模型,是通过预测下一帧图片来理解世界。如果下一帧预测得很好,就认为机器人理解了世界怎么变化。但我们想做的是,不仅要知道下一帧是什么,还要让机器人理解它是怎么从这一帧变到下一帧的。”

除此之外,真实机器人采集到的视频也并不总是严格均匀。不同设备可能具有不同帧率,即便标称相同,传感器实际采样时间也可能出现误差或掉帧。离散模型往往弱化了这些真实的时间差异。

于是,ODEWorld 试图把“物理时间”重新带回世界模型:它关心的不再只是下一张画面是什么,而是此刻的世界正在朝什么方向、以怎样的速度变化?

图 | 生成效果(来源:受访者提供)

不再一帧帧猜,而是学习“世界往哪里走”

为了解决这一问题,研究团队提出了物理时间流(PT-Flow)。它不再直接学习这一帧之后是哪一帧,而是把世界的变化表示成一个随真实时间连续演化的过程。

第一步,是先把复杂的视觉信息压缩下来。

ODEWorld 使用预训练的 DINOv2 提取图像特征,再进一步把真正随时间变化的信息压缩到一个更小的空间中。原因在于,一张图片里包含大量背景、纹理等信息,但这些内容并不都与物体如何运动有关。

刘东岫认为,这种压缩对于面向机器人的世界模型尤其重要。“机器人最后要部署到真实世界,它不可能带着大量显卡支撑计算,因此必须高效压缩世界表征。”模型真正需要留下的,不是所有像素细节,而是有用的动态信息,也就是对世界变化本身的理解。

为此,团队设计了动态表征解耦,把相对稳定的背景和初始状态,与随时间不断变化的动态信息尽量分开,让模型集中表示什么发生了变化。同时,通过图像重建进行约束,保证压缩后的信息没有丢掉理解当前场景所必需的内容。

这种设计还试图解决隐空间世界模型中一个常见问题——表征坍塌(representation collapse)。

简单来说,如果压缩过头,不同画面、不同动作阶段可能最终都被模型表示成几乎一样的状态。刘东岫把这种情况形容为模型“摆烂了”:无论看到什么,都输出差不多的东西。这样虽然预测变得容易,但模型也失去了真正区分世界状态的能力。

ODEWorld 的做法,是把“保留状态信息”和“预测未来变化”拆开监督:一方面通过重建保证压缩后的表征仍然包含足够信息,另一方面专门学习这些状态如何随时间变化。论文的表征分析也显示,这种方式能够明显降低坍塌风险。

接下来是 PT-Flow 最关键的一步:学习世界变化的方向和速度。

虽然训练数据仍然是一帧帧图片,但相邻画面之间有真实的时间间隔。团队先从这些观测中估计变化速度,再通过 JVP(Jacobian-vector product,雅可比向量积)把图像层面的变化映射到压缩空间,得到更连续、平滑的动态变化,并让模型直接学习这种变化规律。

这样,ODEWorld 学到的就不再只是“A 之后是 B”,而是从 A 到 B 之间的状态怎样连续变化。

预测时,模型从当前状态出发,通过普通微分方程(ODE)求解器把每一刻的变化不断累积起来,因此可以得到未来任意时间点的状态。原本两帧之间没有被拍下来的时刻,也可以沿着这条连续轨迹推演出来。

图 | 任意时间分辨率生成(来源:受访者提供)

刘东岫举例说,如果数据集中前后两帧相隔 0.1 秒,ODEWorld 可以进一步预测 0.01 秒、0.05 秒等中间时刻的状态,并呈现连续的变化趋势。

同一套连续轨迹还可以反向求解。在不额外训练新模型的情况下,改变积分方向,ODEWorld 就可以从当前状态向过去反推。刘东岫将这一实验视为对模型连续性的一项验证:它不是简单把已有视频倒放,而是沿着模型学到的变化规律反向推演。

图 | 反向生成(来源:受访者提供)

这种在紧凑空间中预测的方式也带来了较高的计算效率。64 帧长程视频预测实验中,ODEWorld 在单张 A100 GPU 上的预测延迟为 0.072 秒,而 V-JEPA 2 和 LDP 分别为 0.619 秒和 3.953 秒。

预测速度提高的同时,画面质量也保持了较好的水平。在 64 帧长程预测中,ODEWorld 的 PSNR 达到 19.46(数值越高,说明预测画面与真实画面在像素上越接近),高于 V-JEPA 2 的 16.47 和 LDP 的 16.27;感知相似度指标 LPIPS 为 0.134(数值越低,说明看起来越自然、越接近真实),也优于另外两种方法。

因此,PT-Flow 改变的并不只是能否补出更多中间画面,而是世界模型描述变化的方式:传统方法主要学习“A 之后是什么”,ODEWorld 则进一步尝试学习“A 是怎样连续走到 B 的”。

从预测未来,到指导机器人行动

连续建模是否有价值,最终还要回到机器人任务本身:它能不能帮助机器人把动作做得更好?

为此,研究团队没有把 ODEWorld 生成的未来画面直接交给机器人,而是利用模型学到的连续轨迹,在当前状态和任务目标之间生成一系列中间状态,也就是隐空间子目标(latent subgoals)。

可以把它理解为给机器人增加了一组“中途路标”。例如完成插笔任务,机器人不能从“拿着笔”直接跳到“笔已经插进笔筒”,中间还要经历靠近笔筒、调整位置、对准开口、逐渐插入等多个阶段。ODEWorld 根据学到的世界变化规律预测这些中间状态,再把它们提供给下游动作模型,帮助机器人判断下一步应该朝哪里行动。

论文分别测试了速度信息、单个中间目标和连续多个中间目标三种指导方式。其中,连续提供多个子目标的效果最好。在 LIBERO-LONG 的 10 项长程操作任务中,这一方案平均成功率达到 83.6%。

研究团队随后将方法部署到真实双臂机器人上,测试夹虾入锅、鼠标收纳、插笔和双臂整理物体等 4 项任务。在底层 X-VLA 动作模型保持一致的情况下,加入 ODEWorld 提供的连续中间目标后,4 项任务的平均成功率从 55% 提高到 80%。

这组实验表明,ODEWorld 学到的连续变化信息不仅能够用于预测未来,也能够进一步转化为机器人执行任务时可以利用的指导信号。

刘东岫更期待的一个变化,是提高机器人学习新任务的数据效率。

机器人领域真正带有动作标注的数据仍然有限。如果世界模型能够先从更多图像和视频中学习世界如何变化,再把这种能力迁移给下游策略模型,就有机会减少每一个具体任务需要的机器人操作数据。

刘东岫表示,团队后续也希望继续推进 scaling,使这类世界模型逐渐成为更通用的上游模型,再通过较少的下游数据适配具体机器人任务,提高真实执行的准确率。

不过,ODEWorld 目前解决的仍然只是物理世界建模中的一部分问题。真实世界除了时间上的连续变化,还存在接触、碰撞、摩擦和力等更加复杂的物理规律。当前 ODEWorld 并没有对这些因素进行建模。

刘东岫也并不把连续时间视作世界模型的最终答案。“我们不会说它就是终局。”在他的判断中,未来更完整的方向应该是物理世界模型,而连续时间会是其中一个重要组成部分。

1.https://dstate.github.io/odeworld_website/

2.https://arxiv.org/abs/2607.27924

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成

相关内容

热门资讯

长征五号B遥一运载火箭顺利通过... 2020年1月19日,长征五号B遥一运载火箭顺利通过了航天科技集团有限公司在北京组织的出厂评审。目前...
9所本科高校获教育部批准 6所... 1月19日,教育部官方网站发布了关于批准设置本科高等学校的函件,9所由省级人民政府申报设置的本科高等...
9所本科高校获教育部批准 6所... 1月19日,教育部官方网站发布了关于批准设置本科高等学校的函件,9所由省级人民政府申报设置的本科高等...
湖北省黄冈市人大常委会原党组成... 据湖北省纪委监委消息:经湖北省纪委监委审查调查,黄冈市人大常委会原党组成员、副主任吴美景丧失理想信念...
《大江大河2》剧组暂停拍摄工作... 搜狐娱乐讯 今天下午,《大江大河2》剧组发布公告,称当前防控疫情是重中之重的任务,为了避免剧组工作人...