中文

Sherpa3D:通过粗略3D先验促进高保真文本到3D生成

计算机视觉与模式识别 2023-12-12 v1 图形学 机器学习

摘要

最近,利用2D和3D扩散模型,从文本提示创建3D内容已展现出显著进展。虽然3D扩散模型确保了出色的多视角一致性,但其生成高质量和多样化3D资产的能力受到有限3D数据的阻碍。相比之下,2D扩散模型找到了一种无需任何3D数据即可实现出色泛化和丰富细节的蒸馏方法。然而,2D提升方法存在固有的视角不可知模糊性,从而导致严重的多面 Janus 问题,即文本提示无法提供充分的指导来学习连贯的3D结果。我们没有重新训练昂贵的视角感知模型,而是研究如何充分利用易于获取的粗略3D知识来增强提示并指导2D提升优化以进行细化。在本文中,我们提出了 Sherpa3D,一个同时实现高保真、泛化性和几何一致性的新文本到3D框架。具体而言,我们设计了一对源自3D扩散模型生成的粗略3D先验的指导策略:用于几何保真度的结构指导和用于3D一致性的语义指导。采用这两种指导,2D扩散模型以多样化和高质量的结果丰富了3D内容。大量实验表明,我们的 Sherpa3D 在质量和3D一致性方面优于最先进的文本到3D方法。

关键词

引用

@article{arxiv.2312.06655,
  title  = {Sherpa3D: Boosting High-Fidelity Text-to-3D Generation via Coarse 3D Prior},
  author = {Fangfu Liu and Diankun Wu and Yi Wei and Yongming Rao and Yueqi Duan},
  journal= {arXiv preprint arXiv:2312.06655},
  year   = {2023}
}

备注

Project page: https://liuff19.github.io/Sherpa3D/