Magic3D:高分辨率文本到3D内容生成
计算机视觉与模式识别
2023-03-28 v2 图形学
机器学习
摘要
DreamFusion 近期展示了利用预训练文本到图像扩散模型优化神经辐射场(NeRF)的效用,取得了显著的文本到3D合成结果。然而,该方法有两个固有局限:(a)NeRF 优化极慢;(b)对 NeRF 的低分辨率图像空间监督,导致处理时间长且生成的3D模型质量低。本文中,我们通过采用两阶段优化框架来解决这些局限。首先,我们使用低分辨率扩散先验获得粗模型,并通过稀疏3D哈希网格结构加速。以粗表示为初始化,我们进一步利用高效可微渲染器与高分辨率潜扩散模型交互,优化带纹理的3D网格模型。我们的方法称为 Magic3D,可在40分钟内创建高质量3D网格模型,比 DreamFusion(据报平均耗时1.5小时)快2倍,且达到更高分辨率。用户研究表明61.7%的评分者更偏好我们的方法而非 DreamFusion。结合图像条件生成能力,我们为用户提供了控制3D合成的新方式,为各类创意应用开辟了新途径。
引用
@article{arxiv.2211.10440,
title = {Magic3D: High-Resolution Text-to-3D Content Creation},
author = {Chen-Hsuan Lin and Jun Gao and Luming Tang and Towaki Takikawa and Xiaohui Zeng and Xun Huang and Karsten Kreis and Sanja Fidler and Ming-Yu Liu and Tsung-Yi Lin},
journal= {arXiv preprint arXiv:2211.10440},
year = {2023}
}
备注
Accepted to CVPR 2023 as highlight. Project website: https://research.nvidia.com/labs/dir/magic3d