中文

X-Foresight:基于预测世界建模的联合视觉-动作因果预测网络

计算机视觉与模式识别 2026-05-26 v1

摘要

物理世界知识主要驻留在视频中。为视觉-语言-动作(VLA)模型配备此类知识对于实现安全和可泛化的规划至关重要。预测世界建模使VLA能够通过预测过去观察后的未来视频来内化物理动态和长期因果关系。然而,朴素的下一帧预测面临两个挑战:1)与语义上distinct的文本标记不同,视频标记是低熵且冗余的,导致预测退化为平凡的外推;2)世界建模提出了时间困境:密集预测捕捉瞬时动态,但无法有效建模长期因果。为有效学习世界知识,我们引入X-Foresight,将预测世界模型直接集成到VLA架构中,以联合学习世界建模和实时动作控制。其核心在于一种长期分块自回归策略,既解决了上述两个挑战:通过预测语义上遥远的块而非相邻帧,逃避平凡外推,同时保持块内稠密帧以捕捉瞬时动态和稀疏块间转换以建模长期因果。我们进一步采用课程学习计划逐步扩展预测时程并稳定长期训练。为有效捕捉长期因果,我们提出时间重要性抽样,将监督集中在由自我运动和行为信号识别的关键安全块上。我们进一步将逼真合成委托给基于扩散的多视角渲染器,以提高逼真度。全面实验表明,X-Foresight在规划性能上显著优于VLA基线,同时保持强大的生成保真度,确立了面向基于世界知识的自主系统的稳健范式。

关键词

引用

@article{arxiv.2605.24892,
  title  = {X-Foresight: A Joint Vision-Action Causal Forecasting Network via Predictive World Modeling},
  author = {Baolu Li and Jingyu Qian and Rui Guo and Yilun Chen and Hanpeng Liu and Yuan Lin and Junhong Zhou and Ruixin Liu and Willow Yang and Yutong Zheng and Zhenli Zhang and Tenglong and Gu and Zhuangzhuang Ding and Pengkun Zheng and Yu Zhang and Xianming Liu},
  journal= {arXiv preprint arXiv:2605.24892},
  year   = {2026}
}