中文

Voyager:用于可探索 3D 场景生成的长程且世界一致视频扩散

计算机视觉与模式识别 2025-06-05 v1

摘要

现实世界应用(如视频游戏和虚拟现实)常要求能够构建用户可关键帧沿自定义相机轨迹探索的 3D 场景。虽然已对从文本或图像生成 3D 对象的进展显著,但创建长程、3D 一致且可探索的 3D 场景仍是一个复杂且具挑战性的问题。本文提出了 Voyager,一种新型视频扩散框架,可从单张图像生成带有用户定义相机路径的 world-consistent 3D 点云序列。不同于现有方法,Voyager 实现了端到端场景生成与重建,并在帧之间天然保持一致性,无需 3D 重建管道(如结构从运动或多视图立体)。我们的方法集成了三个关键组件:1)世界一致视频扩散:一种统一架构联合生成对齐的 RGB 与深度视频序列,条件化现有 world observation 以确保全局一致性 2)长程世界探索:一种高效的 world 缓存配合点剔除和自回归推理,结合平滑视频采样实现上下文感知的场景扩展 3)可扩展数据引擎:一种视频重建管道自动化相机姿态估计和度量深度预测,使大规模、多样化的训练数据编排无需手动 3D 标注。综合这些设计,Voyager 在视觉质量和几何精度方面均显著优于现有方法,并具备多样化的应用前景。

关键词

引用

@article{arxiv.2506.04225,
  title  = {Voyager: Long-Range and World-Consistent Video Diffusion for Explorable 3D Scene Generation},
  author = {Tianyu Huang and Wangguandong Zheng and Tengfei Wang and Yuhao Liu and Zhenwei Wang and Junta Wu and Jie Jiang and Hui Li and Rynson W. H. Lau and Wangmeng Zuo and Chunchao Guo},
  journal= {arXiv preprint arXiv:2506.04225},
  year   = {2025}
}