中文

LATTE3D:大规模摊销式文本到增强3D合成

计算机视觉与模式识别 2024-03-25 v1 人工智能 图形学 机器学习

摘要

近期的文本到3D生成方法产生了令人印象深刻的3D结果,但需要耗时的优化,每个提示可能耗时长达一小时。像 ATT3D 这样的摊销方法同时优化多个提示以提高效率,从而实现快速的文本到3D合成。然而,它们无法捕捉高频几何和纹理细节,并且难以扩展到大型提示集,因此泛化能力差。我们引入 LATTE3D,解决这些限制,以在显著更大的提示集上实现快速、高质量的生成。我们方法的关键在于 1) 构建可扩展的架构,以及 2) 在优化过程中通过3D感知扩散先验、形状正则化和模型初始化来利用3D数据,以实现对多样且复杂的训练提示的鲁棒性。LATTE3D 同时摊销神经场和纹理表面生成,以在单次前向传递中生成高度详细的纹理网格。LATTE3D 在 400ms 内生成3D对象,并可通过快速的测试时优化进一步增强。

关键词

引用

@article{arxiv.2403.15385,
  title  = {LATTE3D: Large-scale Amortized Text-To-Enhanced3D Synthesis},
  author = {Kevin Xie and Jonathan Lorraine and Tianshi Cao and Jun Gao and James Lucas and Antonio Torralba and Sanja Fidler and Xiaohui Zeng},
  journal= {arXiv preprint arXiv:2403.15385},
  year   = {2024}
}

备注

See the project website at https://research.nvidia.com/labs/toronto-ai/LATTE3D/