T2M-HiFiGPT:利用残差离散表示从文本描述生成高质量人体运动
计算机视觉与模式识别
2023-12-27 v2
摘要
在本研究中,我们引入了 T2M-HiFiGPT,一种用于从文本描述合成人体运动的新型条件生成框架。该框架由残差向量量化变分自编码器(RVQ-VAE)和双层生成式预训练 Transformer(GPT)架构支撑。我们证明了基于 CNN 的 RVQ-VAE 能够产生高精度的二维时间-残差离散运动表示。我们提出的双层 GPT 结构包含一个时间 GPT 和一个残差 GPT。时间 GPT 将来自先前帧和文本描述的信息高效地压缩为一个一维上下文向量。该向量随后作为残差 GPT 的上下文提示,由其生成最终的残差离散索引。这些索引随后被 RVQ-VAE 解码器转换回运动数据。为了缓解曝光偏差问题,我们对 RVQ 采用了直接的码损坏技术和条件 dropout 策略,从而增强了合成性能。值得注意的是,T2M-HiFiGPT 不仅简化了生成过程,而且在性能和参数效率上均超越了现有方法,包括最新的基于扩散和基于 GPT 的模型。在 HumanML3D 和 KIT-ML 数据集上,我们的框架在几乎所有主要指标上都取得了卓越的结果。我们进一步通过在 HumanML3D 数据集上的全面消融实验验证了我们框架的有效性,检验了每个组件的贡献。我们的研究结果表明,与 VQ-VAE 相比,RVQ-VAE 在计算需求相当的情况下更擅长捕捉精确的三维人体运动。因此,T2M-HiFiGPT 能够以显著提高的准确率生成人体运动,优于 T2M-GPT 和 Att-T2M 等近期最先进的方法。
引用
@article{arxiv.2312.10628,
title = {T2M-HiFiGPT: Generating High Quality Human Motion from Textual Descriptions with Residual Discrete Representations},
author = {Congyi Wang},
journal= {arXiv preprint arXiv:2312.10628},
year = {2023}
}
备注
arXiv admin note: text overlap with arXiv:2301.06052 by other authors