中文

LiveWorld: 生成式视频世界模型中视野外动态的模拟

计算机视觉与模式识别 2026-03-25 v2

摘要

最近的生成式视频世界模型旨在模拟视觉环境的演化,允许观察者通过相机控制交互式地探索场景。然而,它们隐含地假设世界仅在观察者视野内演化。一旦物体离开观察者视野,其状态便在记忆中被“冻结”,稍后重新访问同一区域时,往往无法反映在此期间应发生的事件。在这项工作中,我们识别并形式化了这个被忽视的局限性,称之为“视野外动态”问题,它阻碍了视频世界模型表示一个持续演化的世界。为解决此问题,我们提出了 LiveWorld,一个新颖的框架,将视频世界模型扩展为支持持久的世界演化。LiveWorld 不是将世界视为静态的观察记忆,而是建模一个由静态3D背景和动态实体组成的持久全局状态,这些实体即使在未被观察时也会持续演化。为了维持这些不可见的动态,LiveWorld 引入了一种基于监视器的机制,该机制自主模拟活动实体的时间进程,并在重新访问时同步其演化后的状态,确保空间一致的渲染。为了评估,我们进一步引入了 LiveBench,一个专门用于维持视野外动态任务的基准。大量实验表明,LiveWorld 实现了持久的事件演化和长期场景一致性,弥合了现有基于2D观察的记忆与真正的4D动态世界模拟之间的差距。基线和基准将在 https://zichengduan.github.io/LiveWorld/index.html 公开提供。

关键词

引用

@article{arxiv.2603.07145,
  title  = {LiveWorld: Simulating Out-of-Sight Dynamics in Generative Video World Models},
  author = {Zicheng Duan and Jiatong Xia and Zeyu Zhang and Wenbo Zhang and Gengze Zhou and Chenhui Gou and Yefei He and Feng Chen and Xinyu Zhang and Lingqiao Liu},
  journal= {arXiv preprint arXiv:2603.07145},
  year   = {2026}
}