中文

Dive3D:基于Score Implicit Matching的多样化文本到3D生成

计算机视觉与模式识别 2025-06-17 v1

摘要

通过从预训练2D扩散模型蒸馏到3D资产,实现了文本到3D合成的显著进展。然而,现有方法通常依赖基于KL发散的得分蒸馏采样(SDS)损失,这种形式本身倾向于模式寻求行为,限制了生成的多样性。本文提出Dive3D,一种新的文本到3D生成框架,用得分隐式匹配(SIM)损失取代KL基于目标的方法,有效缓解模式坍缩。此外,Dive3D整合了扩散蒸馏和奖励引导优化,基于统一的发散视角进行。这种改造,以及SIM损失,使得生成的3D输出在多样性、文本对齐、人类偏好和整体视觉保真度方面均显著提升。我们在各种2D到3D提示下验证了Dive3D,定性评估表明其在多样性、照片 realism 和审美吸引力方面 consistently 优于先前方法。我们进一步在GPTEval3D基准上评估其性能,对比九个最先进的基线,Dive3D在定量指标上也取得了强劲的成绩,包括文本-资产对齐、3D 合理性、文本-几何一致性、纹理质量和几何细节。

关键词

引用

@article{arxiv.2506.13594,
  title  = {Dive3D: Diverse Distillation-based Text-to-3D Generation via Score Implicit Matching},
  author = {Weimin Bai and Yubo Li and Wenzheng Chen and Weijian Luo and He Sun},
  journal= {arXiv preprint arXiv:2506.13594},
  year   = {2025}
}