中文

SPAD:空间感知的多视图扩散模型

计算机视觉与模式识别 2024-02-09 v1

摘要

我们提出了 SPAD,一种从文本提示或单张图像创建一致多视图图像的新方法。为了实现多视图生成,我们通过扩展其自注意力层以包含跨视图交互,重新利用了一个预训练的 2D 扩散模型,并在 Objaverse 的高质量子集上对其进行了微调。我们发现,先前工作(例如 MVDream)中提出的自注意力的简单扩展会导致视图之间的内容复制。因此,我们基于对极几何显式地约束跨视图注意力。为了进一步增强 3D 一致性,我们利用从相机射线导出的 Plücker 坐标,并将其作为位置编码注入。这使得 SPAD 能够很好地在 3D 空间中推理空间邻近性。与最近只能生成固定方位角和仰角视图的工作相比,SPAD 提供了完整的相机控制,并在来自 Objaverse 和 Google Scanned Objects 数据集的未见过的物体上实现了新视图合成的最先进结果。最后,我们证明了使用 SPAD 进行文本到 3D 生成可以防止多面 Janus 问题。更多细节请访问我们的网页:https://yashkant.github.io/spad

关键词

引用

@article{arxiv.2402.05235,
  title  = {SPAD : Spatially Aware Multiview Diffusers},
  author = {Yash Kant and Ziyi Wu and Michael Vasilkovsky and Guocheng Qian and Jian Ren and Riza Alp Guler and Bernard Ghanem and Sergey Tulyakov and Igor Gilitschenski and Aliaksandr Siarohin},
  journal= {arXiv preprint arXiv:2402.05235},
  year   = {2024}
}

备注

Webpage: https://yashkant.github.io/spad