中文

TPA3D:面向快速文本到三维生成的三平面注意力机制

计算机视觉与模式识别 2024-10-01 v4

摘要

由于缺乏大规模文本-三维对应数据,近期的文本到三维生成工作主要依赖利用二维扩散模型来合成三维数据。由于基于扩散的方法通常需要大量的训练和推理优化时间,使用基于GAN的模型对于快速三维生成仍然具有吸引力。本文提出了用于文本引导三维生成的三平面注意力(TPA3D)模型,这是一种端到端可训练的基于GAN的深度学习模型,旨在实现快速的文本到三维生成。在训练期间仅观察三维形状数据及其渲染的二维图像,我们的TPA3D被设计用于检索详细的视觉描述以合成相应的三维网格数据。这是通过在提取的句子级和词级文本特征上应用所提出的注意力机制来实现的。实验表明,TPA3D能够生成与细粒度描述对齐的高质量三维纹理形状,同时展现出令人瞩目的计算效率。

关键词

引用

@article{arxiv.2312.02647,
  title  = {TPA3D: Triplane Attention for Fast Text-to-3D Generation},
  author = {Bin-Shih Wu and Hong-En Chen and Sheng-Yu Huang and Yu-Chiang Frank Wang},
  journal= {arXiv preprint arXiv:2312.02647},
  year   = {2024}
}

备注

ECCV2024, Project Page: https://redxouls.github.io/TPA3D/