中文

UpFusion:从无位姿稀疏视图观测中进行新视角扩散

计算机视觉与模式识别 2024-01-05 v2

摘要

我们提出了 UpFusion,这是一个系统,能够在给定一组没有对应位姿信息的稀疏参考图像的情况下,对物体进行新视角合成并推断其三维表示。当前的稀疏视角三维推理方法通常依赖相机位姿来几何地聚合来自输入视图的信息,但在野外场景中,当此类信息不可用或不准确时,这些方法并不鲁棒。相比之下,UpFusion 通过学习在条件生成模型中隐式地利用可用图像作为上下文来合成新视角,从而规避了这一要求。我们在扩散模型中引入了两种互补的条件形式来利用输入视图:a)通过使用场景级 Transformer 推断查询视图对齐的特征,b)通过可以直接观察输入图像块的中间注意力层。我们表明,这种机制允许生成高保真度的新视角,同时在给定额外(无位姿)图像的情况下提高合成质量。我们在 Co3Dv2 和 Google Scanned Objects 数据集上评估了我们的方法,并证明了我们的方法相对于依赖位姿的稀疏视角方法以及无法利用额外视图的单视角方法的优势。最后,我们还展示了我们学习到的模型可以泛化到训练类别之外,甚至允许从野外通用物体的自拍图像进行重建。

关键词

引用

@article{arxiv.2312.06661,
  title  = {UpFusion: Novel View Diffusion from Unposed Sparse View Observations},
  author = {Bharath Raj Nagoor Kani and Hsin-Ying Lee and Sergey Tulyakov and Shubham Tulsiani},
  journal= {arXiv preprint arXiv:2312.06661},
  year   = {2024}
}

备注

Project Page: https://upfusion3d.github.io/ v2: Fixed a citation mistake