中文

面向视觉-语言-动作模型的具象化 4D 表示学习世界动态的 Pri4R

计算机视觉与模式识别 2026-03-11 v2 人工智能 机器人学

摘要

人类不仅学习身体如何运动,还学习周围世界如何响应自己的动作。相比之下,虽然近期的视觉-语言-动作(VLA)模型在语义理解方面表现突出,但往往无法捕捉支配物理相互作用的时空动力学。本文引入 Pri4R,一种简单而有效的方法,使 VLA 模型能够通过在训练期间利用具象化 4D 信息来内在地理解世界动力学。具体而言,Pri4R 为 VLA 模型增添了一个轻量级的点轨迹头部,预测 3D 点轨迹。通过将 VLA 特征注入该头部,联合预测未来 3D 轨迹,模型学习在其共享表示空间中融合不断演变的场景几何,从而为精确控制提供更具物理感知力的上下文。由于其架构的简单性,Pri4R 与主流 VLA 设计模式兼容,需极少的修改。在推理期间,我们使用原始 VLA 架构保持不变;Pri4R 不添加额外输入、输出或计算开销。在仿真和真实世界的评估中,Pri4R 在具有挑战性的操控任务上显著提升了性能,包括在 LIBERO-Long 上的提升达 10%,在 RoboCasa 上的提升达 40%。我们进一步表明,3D 点轨迹预测是学习动作-世界动力学的有效监督目标,并通过大量消融实验验证了设计选择。项目页面:https://jiiiisoo.github.io/Pri4R/。

关键词

引用

@article{arxiv.2603.01549,
  title  = {Pri4R: Learning World Dynamics for Vision-Language-Action Models with Privileged 4D Representation},
  author = {Jisoo Kim and Jungbin Cho and Sanghyeok Chu and Ananya Bal and Jinhyung Kim and Gunhee Lee and Sihaeng Lee and Seung Hwan Kim and Bohyung Han and Hyunmin Lee and Laszlo A. Jeni and Seungryong Kim},
  journal= {arXiv preprint arXiv:2603.01549},
  year   = {2026}
}