中文

MoMask:三维人体运动的生成式掩码建模

计算机视觉与模式识别 2023-12-04 v1

摘要

我们提出 MoMask,一种用于文本驱动三维人体运动生成的新型掩码建模框架。在 MoMask 中,采用分层量化方案将人体运动表示为具有高保真细节的多层离散运动 token。从基底层开始,通过向量量化获得运动 token 序列,并推导出递增阶数的残差 token 存储于层级的后续层中。随后使用两个独立的双向 transformer。对于基底层运动 token,指定一个 Masked Transformer 在训练阶段基于文本输入预测随机掩码的运动 token。在生成(即推理)阶段,从空序列开始,我们的 Masked Transformer 迭代地填充缺失 token;随后,一个 Residual Transformer 学习基于当前层结果逐步预测下一层 token。大量实验表明,MoMask 在文本到运动生成任务上优于最先进方法,在 HumanML3D 数据集上 FID 为 0.045(例如 T2M-GPT 为 0.141),在 KIT-ML 上分别为 0.228(vs 0.514)。MoMask 也可无缝应用于相关任务而无需进一步模型微调,例如文本引导的时间修复。

关键词

引用

@article{arxiv.2312.00063,
  title  = {MoMask: Generative Masked Modeling of 3D Human Motions},
  author = {Chuan Guo and Yuxuan Mu and Muhammad Gohar Javed and Sen Wang and Li Cheng},
  journal= {arXiv preprint arXiv:2312.00063},
  year   = {2023}
}

备注

Project webpage: https://ericguo5513.github.io/momask/