中文

PlacidDreamer:文本到3D生成中的和谐提升

计算机视觉与模式识别 2024-07-22 v1

摘要

最近,文本到3D生成引起了广泛关注,取得了显著的性能提升。以往的方法利用端到端3D生成模型初始化3D高斯,利用多视角扩散模型实现多视角一致性,以及利用得分蒸馏算法对文本到图像扩散模型进行细节优化。然而,这些方法存在两个局限性:首先,由于不同模型旨在生成多样化的3D资产,这些方法在生成方向上存在冲突;其次,得分蒸馏的过饱和问题尚未得到充分调查和解决。为此,我们提出PlacidDreamer,一个将初始化、多视角生成和文本条件生成与单个多视角扩散模型和谐统一的文本到3D框架,同时采用新颖的得分蒸馏算法实现平衡饱和度。为统一生成方向,我们引入Latent-Plane模块,一种训练友好的可插拔式扩展,使多视角扩散模型能够为初始化提供快速几何重建,并为文本到图像扩散模型提供个性化的多视角图像。为解决过饱和问题,我们将得分蒸馏视为多目标优化问题,提出Balanced Score Distillation算法,该算法提供的帕累托最优解实现了丰富细节和平衡饱和度。大量实验验证了PlacidDreamer的卓越能力。代码已公开于\url{https://github.com/HansenHuang0823/PlacidDreamer}。

关键词

引用

@article{arxiv.2407.13976,
  title  = {PlacidDreamer: Advancing Harmony in Text-to-3D Generation},
  author = {Shuo Huang and Shikun Sun and Zixuan Wang and Xiaoyu Qin and Yanmin Xiong and Yuan Zhang and Pengfei Wan and Di Zhang and Jia Jia},
  journal= {arXiv preprint arXiv:2407.13976},
  year   = {2024}
}

备注

Accepted by ACM Multimedia 2024