MVD$^2$:面向多视图扩散的高效多视图 3D 重建
计算机视觉与模式识别
2024-02-23 v1 图形学
摘要
作为一种有前景的 3D 生成技术,多视图扩散(MVD)因其在泛化性、质量和效率方面的优势而受到广泛关注。MVD 方法首先利用 3D 数据微调预训练的大型图像扩散模型,基于图像或文本提示生成 3D 对象的多个视图,然后通过多视图 3D 重建重构 3D 形状。然而,生成图像中稀疏的视图和不一致的细节使得 3D 重建极具挑战性。我们提出了 MVD,一种针对多视图扩散(MVD)图像的高效 3D 重建方法。MVD 通过投影和卷积将图像特征聚合到 3D 特征体中,随后将体素特征解码为 3D 网格。我们使用 3D 形状集合以及由 3D 形状渲染视图提示生成的 MVD 图像来训练 MVD。为解决生成的多视图图像与 3D 形状真实视图之间的差异,我们设计了一种简单而高效的视图相关训练方案。MVD 提升了 MVD 的 3D 生成质量,且速度快、对各种 MVD 方法具有鲁棒性。训练完成后,它能在不到一秒的时间内从多视图图像中高效解码出 3D 网格。我们使用 Zero-123++ 和 ObjectVerse-LVIS 3D 数据集训练 MVD,并证明了其在利用不同 MVD 方法生成的多视图图像(使用合成图像和真实图像作为提示)生成 3D 模型方面的卓越性能。
引用
@article{arxiv.2402.14253,
title = {MVD$^2$: Efficient Multiview 3D Reconstruction for Multiview Diffusion},
author = {Xin-Yang Zheng and Hao Pan and Yu-Xiao Guo and Xin Tong and Yang Liu},
journal= {arXiv preprint arXiv:2402.14253},
year = {2024}
}