中文

ViewCrafter:驾驭视频扩散模型以实现高保真新视角合成

计算机视觉与模式识别 2024-09-04 v1

摘要

尽管近期在神经 3D 重建方面取得进展,但依赖稠密多视角捕获的局限性限制了其更广泛的应用。本文提出了 ViewCrafter,一种新方法,用于从单张或稀疏图像合成高保真新视角,采用视频扩散模型的先验。我们利用视频扩散模型的强大生成能力,以及基于点的表示提供的粗糙 3D 线索,生成具有精确相机姿态控制的高质量视频帧。为进一步扩大新视角的生成范围,我们设计了迭代视角合成策略,配合相机轨迹规划算法,逐步扩展 3D 线索和新视角覆盖的区域。借助 ViewCrafter,我们可以实现各种应用,例如通过高效优化 3D-GS 表示来实现基于重建的 3D 点和生成新视角的沉浸式体验,以及用于更具想象力的内容创建的场景级文本到 3D 生成。广泛的实验表明,我们的方法在合成高保真且一致的新视角方面表现出强大的泛化能力和卓越的性能。

关键词

引用

@article{arxiv.2409.02048,
  title  = {ViewCrafter: Taming Video Diffusion Models for High-fidelity Novel View Synthesis},
  author = {Wangbo Yu and Jinbo Xing and Li Yuan and Wenbo Hu and Xiaoyu Li and Zhipeng Huang and Xiangjun Gao and Tien-Tsin Wong and Ying Shan and Yonghong Tian},
  journal= {arXiv preprint arXiv:2409.02048},
  year   = {2024}
}

备注

Project page: https://drexubery.github.io/ViewCrafter/