中文

StableDreamer:驯服文本到 3D 中含噪的分数蒸馏采样

计算机视觉与模式识别 2023-12-06 v1 人工智能

摘要

在文本到 3D 生成领域,通过分数蒸馏采样 (SDS) 利用 2D 扩散模型常常导致外观模糊和多面几何等问题,这主要归因于 SDS 损失固有的噪声特性。我们的分析指出,这些挑战的核心在于 2D 扩散过程中的噪声水平、扩散网络架构以及 3D 模型表示之间的相互作用。为了克服这些局限性,我们提出了 StableDreamer,这是一种融合了三项进展的方法。首先,受 InstructNeRF2NeRF 启发,我们将 SDS 生成先验与简单的有监督 L2 重建损失的等价性形式化。这一发现为调试 SDS 提供了一种新工具,我们借此展示了时间退火噪声水平对减少多面几何的影响。其次,我们的分析表明,虽然图像空间扩散有助于提升几何精度,但潜在空间扩散对于生动的色彩渲染至关重要。基于这一观察,StableDreamer 引入了两阶段训练策略,有效结合了这两个方面,从而生成了高保真 3D 模型。第三,我们采用各向异性 3D 高斯表示来替代神经辐射场,以提升整体质量,减少训练期间的内存使用,加快渲染速度,并更好地捕捉半透明物体。StableDreamer 减少了多面几何,生成了精细细节,并且收敛稳定。

关键词

引用

@article{arxiv.2312.02189,
  title  = {StableDreamer: Taming Noisy Score Distillation Sampling for Text-to-3D},
  author = {Pengsheng Guo and Hans Hao and Adam Caccavale and Zhongzheng Ren and Edward Zhang and Qi Shan and Aditya Sankar and Alexander G. Schwing and Alex Colburn and Fangchang Ma},
  journal= {arXiv preprint arXiv:2312.02189},
  year   = {2023}
}