中文

ViewFusion:学习用于新视角合成的可组合扩散模型

计算机视觉与模式识别 2025-06-06 v2 机器学习

摘要

深度学习为新视角合成问题提供了丰富的新方法,从基于神经辐射场(Neural Radiance Field, NeRF)的方法到端到端架构。每种方法都有其特定的优势,但也存在适用性上的局限。本文介绍了 ViewFusion,一种具有无与伦比灵活性的端到端新视角合成生成方法。ViewFusion 包括同时对场景的任意数量输入视图应用扩散去噪步骤,然后结合为每个视图获得的噪声梯度与(推断的)像素加权掩码,确保目标视图的每个区域仅考虑信息量最大的输入视图。我们的方法通过以下方式解决了先前方法的几个局限性:(1) 可训练并在多个场景和物体类别上泛化;(2) 在训练和测试时自适应地接受可变数量的无姿态视图;(3) 即使在严重欠确定的条件下也能生成合理的视图(得益于其生成性质)——同时生成的视图质量与可比方法相当甚至更好。局限性包括未生成场景的 3D 嵌入,导致推理速度相对较慢,且我们的方法仅在相对较小的 Neural 3D Mesh Renderer 数据集上进行了测试。代码地址:https://github.com/bronemos/view-fusion。

关键词

引用

@article{arxiv.2402.02906,
  title  = {ViewFusion: Learning Composable Diffusion Models for Novel View Synthesis},
  author = {Bernard Spiegl and Andrea Perin and Stéphane Deny and Alexander Ilin},
  journal= {arXiv preprint arXiv:2402.02906},
  year   = {2025}
}

备注

Version accepted to TMLR