让2D扩散模型具备3D一致性以实现鲁棒的文本到3D生成
计算机视觉与模式识别
2024-02-07 v4
摘要
随着分数蒸馏的出现,即利用预训练的文本到2D扩散模型在零样本设定下优化神经辐射场(NeRF)的方法,文本到3D生成近期取得了快速进展。然而,2D扩散模型缺乏3D感知,使得基于分数蒸馏的方法难以重建出合理的3D场景。为解决此问题,我们提出 3DFuse,一种将3D感知融入预训练2D扩散模型的新框架,增强了基于分数蒸馏方法的鲁棒性与3D一致性。我们通过首先构建给定文本提示的粗粒度3D结构,然后将投影的、视点特定的深度图作为扩散模型的条件来实现这一点。此外,我们引入了一种训练策略,使2D扩散模型学会处理粗粒度3D结构中的误差与稀疏性以实现鲁棒生成,以及一种确保场景所有视点语义一致性的方法。我们的框架超越了现有方法的局限,对2D扩散模型的3D一致生成具有重要意义。
引用
@article{arxiv.2303.07937,
title = {Let 2D Diffusion Model Know 3D-Consistency for Robust Text-to-3D Generation},
author = {Junyoung Seo and Wooseok Jang and Min-Seop Kwak and Hyeonsu Kim and Jaehoon Ko and Junho Kim and Jin-Hwa Kim and Jiyoung Lee and Seungryong Kim},
journal= {arXiv preprint arXiv:2303.07937},
year = {2024}
}
备注
Project page https://ku-cvlab.github.io/3DFuse/