中文

IC-World:面向共享世界建模的上下文生成

计算机视觉与模式识别 2025-12-03 v1

摘要

基于视频的世界模型最近受到广泛关注,因其能够合成多样化且动态的视觉环境。本文聚焦共享世界建模,即模型从一组输入图像(每个图像代表同一底层世界的不同相机姿态)生成多个视频。我们提出 IC-World,一种新型生成框架,通过激活大型视频模型内在的上下文生成能力,实现对所有输入图像的并行生成。我们进一步通过强化学习中的群体相对策略优化(Group Relative Policy Optimization)对 IC-World 进行精调,同时引入两个新颖的奖励模型,以确保生成视频集中的场景层几何一致性和对象层运动一致性。广泛实验表明,IC-World 在几何一致性和运动一致性方面均显著优于最先进的方法。据我们所知,这是首个系统性地探索基于视频的世界模型处理共享世界建模问题的工作。

关键词

引用

@article{arxiv.2512.02793,
  title  = {IC-World: In-Context Generation for Shared World Modeling},
  author = {Fan Wu and Jiacheng Wei and Ruibo Li and Yi Xu and Junyou Li and Deheng Ye and Guosheng Lin},
  journal= {arXiv preprint arXiv:2512.02793},
  year   = {2025}
}

备注

codes:https://github.com/wufan-cse/IC-World