中文

MVD$^2$:面向多视图扩散的高效多视图 3D 重建

计算机视觉与模式识别 2024-02-23 v1 图形学

摘要

作为一种有前景的 3D 生成技术,多视图扩散(MVD)因其在泛化性、质量和效率方面的优势而受到广泛关注。MVD 方法首先利用 3D 数据微调预训练的大型图像扩散模型,基于图像或文本提示生成 3D 对象的多个视图,然后通过多视图 3D 重建重构 3D 形状。然而,生成图像中稀疏的视图和不一致的细节使得 3D 重建极具挑战性。我们提出了 MVD2^2,一种针对多视图扩散(MVD)图像的高效 3D 重建方法。MVD2^2 通过投影和卷积将图像特征聚合到 3D 特征体中,随后将体素特征解码为 3D 网格。我们使用 3D 形状集合以及由 3D 形状渲染视图提示生成的 MVD 图像来训练 MVD2^2。为解决生成的多视图图像与 3D 形状真实视图之间的差异,我们设计了一种简单而高效的视图相关训练方案。MVD2^2 提升了 MVD 的 3D 生成质量,且速度快、对各种 MVD 方法具有鲁棒性。训练完成后,它能在不到一秒的时间内从多视图图像中高效解码出 3D 网格。我们使用 Zero-123++ 和 ObjectVerse-LVIS 3D 数据集训练 MVD2^2,并证明了其在利用不同 MVD 方法生成的多视图图像(使用合成图像和真实图像作为提示)生成 3D 模型方面的卓越性能。

关键词

引用

@article{arxiv.2402.14253,
  title  = {MVD$^2$: Efficient Multiview 3D Reconstruction for Multiview Diffusion},
  author = {Xin-Yang Zheng and Hao Pan and Yu-Xiao Guo and Xin Tong and Yang Liu},
  journal= {arXiv preprint arXiv:2402.14253},
  year   = {2024}
}