中文

T2M-GPT:基于离散表示从文本描述生成人体运动

计算机视觉与模式识别 2023-09-26 v4

摘要

在这项工作中,我们研究了一种简单且必须了解的条件生成框架,该框架基于向量量化变分自编码器(VQ-VAE)和生成式预训练 Transformer(GPT),用于从文本描述生成人体运动。我们表明,具有常用训练技巧(EMA 和 Code Reset)的简单基于 CNN 的 VQ-VAE 使我们能够获得高质量的离散表示。对于 GPT,我们在训练期间引入了一种简单的损坏策略,以缓解训练与测试之间的差异。尽管其简单性,我们的 T2M-GPT 表现出比竞争方法(包括最近基于扩散的方法)更好的性能。例如,在目前最大的数据集 HumanML3D 上,我们在文本与生成运动之间的一致性(R-Precision)上取得了可比的性能,但 FID 为 0.116,大大优于 MotionDiffuse 的 0.630。此外,我们在 HumanML3D 上进行了分析,观察到数据集大小是我们方法的局限性。我们的工作表明,VQ-VAE 仍然是人体运动生成的一种有竞争力的方法。

关键词

引用

@article{arxiv.2301.06052,
  title  = {T2M-GPT: Generating Human Motion from Textual Descriptions with Discrete Representations},
  author = {Jianrong Zhang and Yangsong Zhang and Xiaodong Cun and Shaoli Huang and Yong Zhang and Hongwei Zhao and Hongtao Lu and Xi Shen},
  journal= {arXiv preprint arXiv:2301.06052},
  year   = {2023}
}

备注

Accepted to CVPR 2023. Project page: https://mael-zys.github.io/T2M-GPT/