中文

NeRDi:以语言引导扩散作为通用图像先验的单视图 NeRF 合成

计算机视觉与模式识别 2022-12-08 v1

摘要

2D 到 3D 重建是一个不适定问题,但人类擅长解决该问题,这得益于其多年来发展的对 3D 世界的先验知识。受此观察驱动,我们提出 NeRDi,一个利用来自 2D 扩散模型的通用图像先验的单视图 NeRF 合成框架。我们将单视图重建表述为图像条件的 3D 生成问题,通过在输入视图约束下,用预训练图像扩散模型对其任意视图渲染图最小化扩散损失来优化 NeRF 表示。我们利用现成的视觉-语言模型,并引入两段式语言引导作为扩散模型的条件输入。这本质上有助于提升多视图内容一致性,因为它基于单视图输入图像的语义与视觉特征缩小了通用图像先验的条件范围。此外,我们引入基于估计深度图的几何损失来正则化 NeRF 的底层 3D 几何。在 DTU MVS 数据集上的实验结果表明,即便与在该数据集上训练过的现有方法相比,我们的方法也能合成更高质量的新视图。我们还展示了我们对野外图像零样本 NeRF 合成的泛化能力。

关键词

引用

@article{arxiv.2212.03267,
  title  = {NeRDi: Single-View NeRF Synthesis with Language-Guided Diffusion as General Image Priors},
  author = {Congyue Deng and Chiyu "Max'' Jiang and Charles R. Qi and Xinchen Yan and Yin Zhou and Leonidas Guibas and Dragomir Anguelov},
  journal= {arXiv preprint arXiv:2212.03267},
  year   = {2022}
}