中文

基于联合得分蒸馏实现文本到 3D 生成中的几何一致性和文本一致性

计算机视觉与模式识别 2024-10-15 v2

摘要

通过经过良好训练的 2D 扩散模型进行得分蒸馏 (SDS) 已在文本到 3D 生成中显示出巨大的潜力。然而,这种范式会将视图无关的 2D 图像分布蒸馏到每个视角的 3D 表示渲染分布中,忽略了跨视角的一致性,导致生成的 3D 不一致。在本文中,我们提出了联合得分蒸馏 (JSD),一种新的范式,以确保一致的 3D 生成。具体而言,我们建模联合图像分布,引入能量函数来捕获来自扩散模型的去噪图像之间的一致性。我们然后在多个渲染视图的 3D 表示上推导联合得分蒸馏,而不是 SDS 中的单个视图。此外,我们实例化了三个通用的视角感知模型作为能量函数,显示其与 JSD 的兼容性。实验上,JSD 显著缓解了 SDS 中的 3D 不一致问题,同时保持文本一致性。此外,我们引入几何淡化方案和无分类器引导 (CFG) 切换策略以增强生成细节。我们的框架 JointDreamer 在文本到 3D 生成中建立了新的基准,实现了 88.5% 的 CLIP R-Precision 和 27.7% 的 CLIP Score,这些指标显示出卓越的文本一致性、几何一致性和纹理保真度。

关键词

引用

@article{arxiv.2407.12291,
  title  = {JointDreamer: Ensuring Geometry Consistency and Text Congruence in Text-to-3D Generation via Joint Score Distillation},
  author = {Chenhan Jiang and Yihan Zeng and Tianyang Hu and Songcun Xu and Wei Zhang and Hang Xu and Dit-Yan Yeung},
  journal= {arXiv preprint arXiv:2407.12291},
  year   = {2024}
}

备注

29 pages, ECCV2024