SweetDreamer:在2D扩散中对齐几何先验以实现一致的文本到3D生成
计算机视觉与模式识别
2023-10-23 v2
摘要
将预训练扩散模型的2D结果提升到3D世界以进行文本到3D生成,本质上具有歧义性。2D扩散模型仅学习视角无关先验,因此在提升过程中缺乏3D知识,导致多视图不一致问题。我们发现该问题主要源于几何不一致,避免错位的几何结构可大幅缓解最终输出中的问题。因此,我们在提升过程中通过将扩散模型中的2D几何先验与明确定义的3D形状对齐来改善一致性,从而解决绝大部分问题。这通过微调2D扩散模型使其具备视角感知能力,并生成规范朝向3D物体的视角特定坐标图来实现。在我们的流程中,仅使用粗粒度3D信息进行对齐。这种“粗”对齐不仅解决了几何中的多视图不一致,还保留了2D扩散模型生成3D数据集中未见的细致且多样化高质量物体的能力。此外,我们的对齐几何先验(AGP)具有通用性,可无缝集成到各种最先进流水线中,在未见形状和视觉外观上获得高泛化性,同时极大缓解多视图不一致问题。我们的方法以85%以上的人工评估一致性率代表了新的最先进性能,而许多先前方法约为30%。我们的项目页面为 https://sweetdreamer3d.github.io/
引用
@article{arxiv.2310.02596,
title = {SweetDreamer: Aligning Geometric Priors in 2D Diffusion for Consistent Text-to-3D},
author = {Weiyu Li and Rui Chen and Xuelin Chen and Ping Tan},
journal= {arXiv preprint arXiv:2310.02596},
year = {2023}
}
备注
Project page: https://sweetdreamer3d.github.io/