中文

VRAG:学习用于交互式视频生成的世界模型

计算机视觉与模式识别 2026-05-29 v4 人工智能

摘要

基础世界模型必须具备交互性并保持时空连贯性,以便通过动作选择进行有效的未来规划。然而,由于累积误差和记忆机制不足这两个主要挑战,当前的长视频生成模型固有的世界建模能力有限。我们通过添加动作条件和自回归框架,增强了图像到视频模型的交互能力,并揭示了在自回归视频生成中累积误差本质上是不可消除的,而记忆机制不足会导致世界模型的不连贯。我们提出了具有显式全局状态条件的视频检索增强生成(VRAG),这显著减少了长期累积误差并提高了世界模型的时空一致性。相比之下,采用扩展上下文窗口的朴素自回归生成和检索增强生成在视频生成中效果较差,这主要归因于当前视频模型的上下文学习能力有限。我们的工作阐明了视频世界模型的基本挑战,并为改进具有内部世界建模能力的视频生成模型建立了一个综合基准。

关键词

引用

@article{arxiv.2505.21996,
  title  = {VRAG: Learning World Models for Interactive Video Generation},
  author = {Taiye Chen and Xun Hu and Zihan Ding and Chi Jin},
  journal= {arXiv preprint arXiv:2505.21996},
  year   = {2026}
}

备注

Published at NeurIPS 2025. Project page: https://sites.google.com/view/vrag