中文

OmniRoam:通过长期全景视频生成实现全景漫游

计算机视觉与模式识别 2026-04-01 v1

摘要

视频生成模型用于场景建模近年来受到了广泛关注,但大多数现有方法依赖于透视视频模型,仅合成受限的场景观察,导致完整性和全局一致性问题。我们提出了 OmniRoam,一种可控全景视频生成框架,利用全景表示中丰富的 per-frame 场景覆盖以及固有的长期空间和时间一致性,实现长期场景漫游。我们的框架包括 preview 阶段和 refine 阶段。在 preview 阶段,轨迹控制的视频生成模型从给定输入图像或视频中创建场景的快速概览。随后,在 refine 阶段,该视频被时间延伸和空间上升采样,以产生长范围、高分辨率视频,从而实现高保真的世界漫游。为训练我们的模型,我们引入了两个包含合成和真实世界捕获视频的全景视频数据集。实验表明,我们的框架在视觉质量、可控性和长期场景一致性方面,无论在定性还是定量评估中,始终优于最先进的方法。我们进一步展示了本框架的几个扩展,包括实时视频生成和 3D 重建。代码可在 https://github.com/yuhengliu02/OmniRoam 获取。

关键词

引用

@article{arxiv.2603.30045,
  title  = {OmniRoam: World Wandering via Long-Horizon Panoramic Video Generation},
  author = {Yuheng Liu and Xin Lin and Xinke Li and Baihan Yang and Chen Wang and Kalyan Sunkavalli and Yannick Hold-Geoffroy and Hao Tan and Kai Zhang and Xiaohui Xie and Zifan Shi and Yiwei Hu},
  journal= {arXiv preprint arXiv:2603.30045},
  year   = {2026}
}

备注

Code is available at https://github.com/yuhengliu02/OmniRoam