中文

DreamLCM:通过潜在一致模型实现高质量文本到3D生成

计算机视觉与模式识别 2025-01-07 v4

摘要

最近,由于SDS方法的出现,文本到3D任务发展迅猛。然而,SDS方法总是生成质量较差的3D对象,由于过平滑问题。这一问题归因于两个因素:1)DDPM单步推理产生较差的引导梯度;2)来自输入噪声和时间步的随机性平均了3D内容的细节。在本文中,为了解决此问题,我们提出了DreamLCM,该方法融合了潜在一致模型(LCM)。DreamLCM利用LCM所固有的强大图像生成能力,实现对一致且高质量的引导(即预测噪声或图像)的生成。凭借改进的引导,所提出的方法能够为优化目标3D模型提供准确且详尽的梯度。此外,我们提出了两种策略进一步提高生成质量。首先,我们提出了引导校准策略,利用欧拉求解器校准引导分布以加快3D模型收敛速度。其次,我们提出了双时间步策略,提高引导的一致性,并在DreamLCM中从几何到外观优化3D模型。实验表明,DreamLCM在生成质量和训练效率方面均实现了最先进的效果。代码可在https://github.com/1YimingZhong/DreamLCM上获取。

关键词

引用

@article{arxiv.2408.02993,
  title  = {DreamLCM: Towards High-Quality Text-to-3D Generation via Latent Consistency Model},
  author = {Yiming Zhong and Xiaolin Zhang and Yao Zhao and Yunchao Wei},
  journal= {arXiv preprint arXiv:2408.02993},
  year   = {2025}
}

备注

15 pages, 9 figures, ACM MM 2024