MVDiffusion++:用于单视图或稀疏视图 3D 物体重建的密集高分辨率多视图扩散模型
计算机视觉与模式识别
2024-05-01 v3
摘要
本文提出了一种用于 3D 物体重建的神经网络架构 MVDiffusion++,它可以在没有相机位姿的情况下,根据一张或几张图像合成物体的密集且高分辨率的视图。MVDiffusion++ 通过两个极其简单的想法实现了卓越的灵活性和可扩展性:1) 一种“无位姿架构”,其中 2D 潜在特征之间的标准自注意力机制在任意数量的条件视图和生成视图中学习 3D 一致性,而无需显式使用相机位姿信息;2) 一种“视图丢弃策略”,在训练期间丢弃大量输出视图,这减少了训练时的内存占用,并能在测试时实现密集且高分辨率的视图合成。我们使用 Objaverse 进行训练,并使用 Google Scanned Objects 结合标准的新视图合成和 3D 重建指标进行评估,其中 MVDiffusion++ 显著优于当前的最先进技术。我们还通过将 MVDiffusion++ 与文本到图像生成模型相结合,展示了文本到 3D 的应用示例。项目页面位于 https://mvdiffusion-plusplus.github.io。
引用
@article{arxiv.2402.12712,
title = {MVDiffusion++: A Dense High-resolution Multi-view Diffusion Model for Single or Sparse-view 3D Object Reconstruction},
author = {Shitao Tang and Jiacheng Chen and Dilin Wang and Chengzhou Tang and Fuyang Zhang and Yuchen Fan and Vikas Chandra and Yasutaka Furukawa and Rakesh Ranjan},
journal= {arXiv preprint arXiv:2402.12712},
year = {2024}
}
备注
3D generation, project page: https://mvdiffusion-plusplus.github.io/