Envision3D:基于锚点视图插值的单图生 3D
计算机视觉与模式识别
2024-03-15 v1
摘要
我们提出了 Envision3D,一种从单张图像高效生成高质量 3D 内容的新方法。近期从扩散模型生成的多视图图像中提取 3D 内容的方法展现出巨大潜力。然而,扩散模型生成密集的多视图一致图像仍具挑战性,而这对于 3D 内容提取的质量至关重要。为解决此问题,我们提出了一种新颖的级联扩散框架,将具有挑战性的密集视图生成任务分解为两个可处理的阶段,即锚点视图生成和锚点视图插值。在第一阶段,我们训练图像扩散模型,以图像-法线对为条件生成全局一致的锚点视图。随后,利用我们在连续多视图图像上微调的视频扩散模型,对先前的锚点视图进行插值以生成额外的密集视图。该框架产生密集且多视图一致的图像,提供全面的 3D 信息。为进一步提升整体生成质量,我们为重建算法引入了由粗到细的采样策略,以从生成的密集图像中稳健地提取带纹理的网格。大量实验表明,我们的方法能够在纹理和几何方面生成高质量的 3D 内容,超越了以往的图像到 3D 基线方法。
引用
@article{arxiv.2403.08902,
title = {Envision3D: One Image to 3D with Anchor Views Interpolation},
author = {Yatian Pang and Tanghui Jia and Yujun Shi and Zhenyu Tang and Junwu Zhang and Xinhua Cheng and Xing Zhou and Francis E. H. Tay and Li Yuan},
journal= {arXiv preprint arXiv:2403.08902},
year = {2024}
}
备注
GitHub repository: https://github.com/PKU-YuanGroup/Envision3D