中文

用于多视角场景修复的几何感知扩散模型

计算机视觉与模式识别 2025-03-12 v2

摘要

本文聚焦于 3D 场景修复,其中从不同视角捕获的输入图像集的部分区域被遮挡。主要挑战在于生成在多视角间几何一致的合理图像补全。最近的大多数工作通过将生成模型与 3D 辐射场相结合,在相对密集的视角集之间融合信息来解决这一挑战。然而,这些方法的一个主要缺点是,由于融合了不一致的跨视角图像,它们通常会产生模糊的图像。为避免模糊的修复,我们完全摒弃了显式或隐式辐射场,转而在一个学习空间中融合跨视角信息。具体而言,我们引入了一个几何感知条件生成模型,能够利用基于参考的几何和外观线索进行多视角一致的修复。与现有方法相比,我们方法的一个关键优势在于其具备使用有限数量视角对遮挡场景进行修复(即少视角修复)的独特能力,而以往的方法在 3D 模型拟合步骤中需要相对庞大的图像集。在实验中,我们在 SPIn-NeRF 和 NeRFiller 两个数据集上评估并比较了这种以场景为中心的修复方法,这两个数据集分别包含窄基线和宽基线捕获的图像,并在两者上均实现了 SOTA 的 3D 修复性能。此外,我们还展示了与先前方法相比,本文方法在少视角设定下的有效性。

关键词

引用

@article{arxiv.2502.13335,
  title  = {Geometry-Aware Diffusion Models for Multiview Scene Inpainting},
  author = {Ahmad Salimi and Tristan Aumentado-Armstrong and Marcus A. Brubaker and Konstantinos G. Derpanis},
  journal= {arXiv preprint arXiv:2502.13335},
  year   = {2025}
}

备注

Our project page is available at https://geomvi.github.io