中文

ModeDreamer: 基于参考图像引导的文本到 3D 生成模式得分蒸馏

计算机视觉与模式识别 2025-03-04 v2

摘要

现有的基于评分蒸馏抽样 (SDS) 的方法推动了文本到 3D 生成的显著进展。然而,SDS 方法生成的 3D 模型容易出现过平滑和低质量输出。这些问题源于当前方法的模式寻求行为,其中用于更新模型的评分在多个模式之间振荡,导致优化不稳定并降低输出质量。为此,我们引入一种名为 ISD 的新型图像提示评分蒸馏损失,该损失利用参考图像引导文本到 3D 优化指向特定模式。我们的 ISD 损失可通过 IP-Adapter 实现,该适配器是将图像提示功能集成到文本到图像扩散模型中的轻量级适配器,作为模式选择模块。该适配器的变体在未使用参考图像时可作为有效的控制变量,用于降低评分估计的方差,从而提升输出质量和优化稳定性。我们的实验表明,ISD 损失在 T3Bench 基准套件上通过定性和定量评估, consistently 实现了视觉上连贯、高质量的输出,并提升了优化速度。

关键词

引用

@article{arxiv.2411.18135,
  title  = {ModeDreamer: Mode Guiding Score Distillation for Text-to-3D Generation using Reference Image Prompts},
  author = {Uy Dieu Tran and Minh Luu and Phong Ha Nguyen and Khoi Nguyen and Binh-Son Hua},
  journal= {arXiv preprint arXiv:2411.18135},
  year   = {2025}
}

备注

Project page: https://modedreamer.github.io/