中文

基于多视角几何扩散的零样态新视角与深度合成

计算机视觉与模式识别 2025-02-03 v1 机器学习

摘要

当前从稀疏定位图像重建3D场景的方法采用中间3D表示(如神经场、体素网格或3D高斯),以实现多视角一致的场景外观与几何。本文引入MVGD(Multi-View Geometric Diffusion),一种基于扩散的架构,能够直接从任意数量的输入视角生成新视角的图像和深度图。我们的方法利用光线图(raymap)条件化,既增强了来自不同视角的视觉特征的空间信息,又引导生成来自新视角的图像和深度图。我们的方法的关键在于使用可学习的任务嵌入进行多任务图像和深度图生成,引导扩散过程聚焦于特定模态。我们在超过6000万个多视角样本上训练了该模型,并提出了技术措施,以在多样化条件下实现高效且一致的学习。我们还提出了一种新策略,使更大模型的训练能够通过逐步微调较小模型来实现,表现出良好的扩展行为。通过大量实验,我们在多个新视角合成基准中报告了最新的成果,以及多视角立体视觉和视频深度估计。

关键词

引用

@article{arxiv.2501.18804,
  title  = {Zero-Shot Novel View and Depth Synthesis with Multi-View Geometric Diffusion},
  author = {Vitor Guizilini and Muhammad Zubair Irshad and Dian Chen and Greg Shakhnarovich and Rares Ambrus},
  journal= {arXiv preprint arXiv:2501.18804},
  year   = {2025}
}

备注

Project page: https://mvgd.github.io