RichDreamer:用于文本到3D细节丰富度的可泛化法线-深度扩散模型
计算机视觉与模式识别
2023-12-27 v2 人工智能
摘要
将2D扩散提升用于3D生成是一个具有挑战性的问题,其原因在于缺乏几何先验以及自然图像中材质与光照的复杂纠缠。现有方法已展现出前景:首先通过对渲染表面法线应用分数蒸馏采样(SDS)创建几何,随后进行外观建模。然而,依赖2D RGB扩散模型优化表面法线由于自然图像与法线图之间的分布差异而并非最优,导致优化不稳定。本文认识到法线与深度信息能有效描述场景几何并可从图像自动估计,我们提出学习一个可泛化的法线-深度扩散模型用于3D生成。我们通过在大规模LAION数据集上结合可泛化的图像到深度与法线先验模型进行训练来实现这一点。为缓解生成材质中的混合光照效应,我们引入反照率扩散模型对反照率分量施加数据驱动约束。实验表明,当集成到现有文本到3D流程中时,我们的模型显著增强了细节丰富度,取得了最先进的结果。项目页面为https://aigc3d.github.io/richdreamer/。
引用
@article{arxiv.2311.16918,
title = {RichDreamer: A Generalizable Normal-Depth Diffusion Model for Detail Richness in Text-to-3D},
author = {Lingteng Qiu and Guanying Chen and Xiaodong Gu and Qi Zuo and Mutian Xu and Yushuang Wu and Weihao Yuan and Zilong Dong and Liefeng Bo and Xiaoguang Han},
journal= {arXiv preprint arXiv:2311.16918},
year = {2023}
}
备注
Project Page: https://aigc3d.github.io/richdreamer/