CityRAG:通过空间接地视频生成步入城市
计算机视觉与模式识别
2026-04-22 v1
摘要
我们解决了生成具有空间接地特性的 3D 一致、可导航环境的问题:即对真实地点的模拟。现有的视频生成模型可以产生与文本(T2V)或图像(I2V)提示一致的合理序列。然而,在任意天气条件和动态物体配置下重建真实世界的能力,对于包括自动驾驶和机器人模拟在内的下游应用是必不可少的。为此,我们提出了 CityRAG,一个利用地理配准数据的大型语料库作为上下文,将生成接地于物理场景的视频生成模型,同时保持对复杂运动和外观变化的学习先验。CityRAG 依赖于时间上未对齐的训练数据,这教会模型将底层场景与其瞬态属性进行语义解耦。我们的实验表明,CityRAG 能够生成连贯的数分钟长、物理接地的视频序列,在数千帧中保持天气和光照条件,实现闭环,并沿复杂轨迹导航以重建真实世界地理。
引用
@article{arxiv.2604.19741,
title = {CityRAG: Stepping Into a City via Spatially-Grounded Video Generation},
author = {Gene Chou and Charles Herrmann and Kyle Genova and Boyang Deng and Songyou Peng and Bharath Hariharan and Jason Y. Zhang and Noah Snavely and Philipp Henzler},
journal= {arXiv preprint arXiv:2604.19741},
year = {2026}
}
备注
Project page: cityrag.github.io