T2M-GPT:基于离散表示从文本描述生成人体运动
计算机视觉与模式识别
2023-09-26 v4
摘要
在这项工作中,我们研究了一种简单且必须了解的条件生成框架,该框架基于向量量化变分自编码器(VQ-VAE)和生成式预训练 Transformer(GPT),用于从文本描述生成人体运动。我们表明,具有常用训练技巧(EMA 和 Code Reset)的简单基于 CNN 的 VQ-VAE 使我们能够获得高质量的离散表示。对于 GPT,我们在训练期间引入了一种简单的损坏策略,以缓解训练与测试之间的差异。尽管其简单性,我们的 T2M-GPT 表现出比竞争方法(包括最近基于扩散的方法)更好的性能。例如,在目前最大的数据集 HumanML3D 上,我们在文本与生成运动之间的一致性(R-Precision)上取得了可比的性能,但 FID 为 0.116,大大优于 MotionDiffuse 的 0.630。此外,我们在 HumanML3D 上进行了分析,观察到数据集大小是我们方法的局限性。我们的工作表明,VQ-VAE 仍然是人体运动生成的一种有竞争力的方法。
引用
@article{arxiv.2301.06052,
title = {T2M-GPT: Generating Human Motion from Textual Descriptions with Discrete Representations},
author = {Jianrong Zhang and Yangsong Zhang and Xiaodong Cun and Shaoli Huang and Yong Zhang and Hongwei Zhao and Hongtao Lu and Xi Shen},
journal= {arXiv preprint arXiv:2301.06052},
year = {2023}
}
备注
Accepted to CVPR 2023. Project page: https://mael-zys.github.io/T2M-GPT/