中文

Mogo:用于高质量三维人体动作生成的 RQ 分层因果 Transformer

计算机视觉与模式识别 2024-12-12 v1

摘要

在文本到动作生成领域,与 GPT 类自回归模型 (T2M-GPT) 相比,Bert 类掩码模型 (MoMask, MMM) 目前能产生更高质量的输出。然而,这些 Bert 类模型通常缺乏视频游戏和多媒体环境应用所需的流式输出能力,而这正是 GPT 类模型的固有特性。此外,它们在分布外生成方面表现较弱。为了在利用 GPT 类结构的同时超越 BERT 类模型的质量,且不增加会使数据扩展复杂化的额外细化模型,我们提出了一种新颖的架构 Mogo(Motion Only Generate Once),它通过训练单个 Transformer 模型来生成高质量、逼真的三维人体动作。Mogo 仅包含两个主要组件:1) RVQ-VAE,一种分层残差向量量化变分自编码器,用于高精度地离散化连续动作序列;2) 分层因果 Transformer,负责以自回归方式生成基础动作序列,同时推断不同层级的残差。实验结果表明,Mogo 可以生成长达 260 帧(13 秒)的连续循环动作序列,超越了现有数据集(如 HumanML3D)196 帧(10 秒)的长度限制。在 HumanML3D 测试集上,Mogo 取得了 0.079 的 FID 分数,优于 GPT 类模型 T2M-GPT(FID = 0.116)、AttT2M(FID = 0.112)和 BERT 类模型 MMM(FID = 0.080)。此外,我们的模型在分布外生成方面取得了最佳的定量性能。

关键词

引用

@article{arxiv.2412.07797,
  title  = {Mogo: RQ Hierarchical Causal Transformer for High-Quality 3D Human Motion Generation},
  author = {Dongjie Fu},
  journal= {arXiv preprint arXiv:2412.07797},
  year   = {2024}
}