中文

CityRAG:通过空间接地视频生成步入城市

计算机视觉与模式识别 2026-04-22 v1

摘要

我们解决了生成具有空间接地特性的 3D 一致、可导航环境的问题:即对真实地点的模拟。现有的视频生成模型可以产生与文本(T2V)或图像(I2V)提示一致的合理序列。然而,在任意天气条件和动态物体配置下重建真实世界的能力,对于包括自动驾驶和机器人模拟在内的下游应用是必不可少的。为此,我们提出了 CityRAG,一个利用地理配准数据的大型语料库作为上下文,将生成接地于物理场景的视频生成模型,同时保持对复杂运动和外观变化的学习先验。CityRAG 依赖于时间上未对齐的训练数据,这教会模型将底层场景与其瞬态属性进行语义解耦。我们的实验表明,CityRAG 能够生成连贯的数分钟长、物理接地的视频序列,在数千帧中保持天气和光照条件,实现闭环,并沿复杂轨迹导航以重建真实世界地理。

关键词

引用

@article{arxiv.2604.19741,
  title  = {CityRAG: Stepping Into a City via Spatially-Grounded Video Generation},
  author = {Gene Chou and Charles Herrmann and Kyle Genova and Boyang Deng and Songyou Peng and Bharath Hariharan and Jason Y. Zhang and Noah Snavely and Philipp Henzler},
  journal= {arXiv preprint arXiv:2604.19741},
  year   = {2026}
}

备注

Project page: cityrag.github.io