中文

AToM: 使用2D扩散的摊销文本到网格

计算机视觉与模式识别 2024-02-02 v1

摘要

我们引入摊销文本到网格(AToM),一种前馈式文本到网格框架,同时跨多个文本提示进行优化。与现有的文本到3D方法通常需要耗时的逐提示优化并且通常输出多边形网格以外的表示不同,AToM在不到1秒内直接生成高质量纹理网格,训练成本降低约10倍,并泛化到未见提示。我们的关键思想是一种新颖的基于三平面的文本到网格架构,采用两阶段摊销优化策略,确保稳定训练并实现可扩展性。通过在多个提示基准上的广泛实验,AToM显著优于最先进的摊销方法,准确率提高4倍以上(在DF415数据集上),并产生更可区分和更高质量的3D输出。AToM展示了强大的泛化能力,为未见插值提示提供细粒度3D资产,无需像逐提示解决方案那样在推理时进一步优化。

关键词

引用

@article{arxiv.2402.00867,
  title  = {AToM: Amortized Text-to-Mesh using 2D Diffusion},
  author = {Guocheng Qian and Junli Cao and Aliaksandr Siarohin and Yash Kant and Chaoyang Wang and Michael Vasilkovsky and Hsin-Ying Lee and Yuwei Fang and Ivan Skorokhodov and Peiye Zhuang and Igor Gilitschenski and Jian Ren and Bernard Ghanem and Kfir Aberman and Sergey Tulyakov},
  journal= {arXiv preprint arXiv:2402.00867},
  year   = {2024}
}

备注

19 pages with appendix and references. Webpage: https://snap-research.github.io/AToM/