中文

Magic3D:高分辨率文本到3D内容生成

计算机视觉与模式识别 2023-03-28 v2 图形学 机器学习

摘要

DreamFusion 近期展示了利用预训练文本到图像扩散模型优化神经辐射场(NeRF)的效用,取得了显著的文本到3D合成结果。然而,该方法有两个固有局限:(a)NeRF 优化极慢;(b)对 NeRF 的低分辨率图像空间监督,导致处理时间长且生成的3D模型质量低。本文中,我们通过采用两阶段优化框架来解决这些局限。首先,我们使用低分辨率扩散先验获得粗模型,并通过稀疏3D哈希网格结构加速。以粗表示为初始化,我们进一步利用高效可微渲染器与高分辨率潜扩散模型交互,优化带纹理的3D网格模型。我们的方法称为 Magic3D,可在40分钟内创建高质量3D网格模型,比 DreamFusion(据报平均耗时1.5小时)快2倍,且达到更高分辨率。用户研究表明61.7%的评分者更偏好我们的方法而非 DreamFusion。结合图像条件生成能力,我们为用户提供了控制3D合成的新方式,为各类创意应用开辟了新途径。

关键词

引用

@article{arxiv.2211.10440,
  title  = {Magic3D: High-Resolution Text-to-3D Content Creation},
  author = {Chen-Hsuan Lin and Jun Gao and Luming Tang and Towaki Takikawa and Xiaohui Zeng and Xun Huang and Karsten Kreis and Sanja Fidler and Ming-Yu Liu and Tsung-Yi Lin},
  journal= {arXiv preprint arXiv:2211.10440},
  year   = {2023}
}

备注

Accepted to CVPR 2023 as highlight. Project website: https://research.nvidia.com/labs/dir/magic3d