中文

T2M-X:从部分标注数据学习表达性文本到运动生成

计算机视觉与模式识别 2024-09-23 v1

摘要

从文本提示生成人类运动动画对动画制作和 AR/VR 体验具有深远影响。然而,现有方法仅生成身体运动数据,未涉及面部表情和手部动作。由于缺乏完整的全身运动数据集,这一局限使其难以用于实际生产。最近尝试构建此类数据集要么导致人工增强数据中不同身体部位的运动不一致,要么导致从 RGB 视频提取的数据质量较低。本文提出 T2M-X,一种从部分标注数据学习表达性文本到运动生成的两阶段方法。T2M-X 在各自高质量数据源上,对身体、手部和面部分别训练三个独立的向量量化变分自编码器(VQ-VAE),以确保高质量运动输出,并使用带有运动一致性损失的多索引生成预训练变换器(GPT)模型进行运动生成和不同身体部位之间的协调。我们的结果在定性和定量分析方面均显著优于基线方法,显示其对数据集限制的鲁健性。

关键词

引用

@article{arxiv.2409.13251,
  title  = {T2M-X: Learning Expressive Text-to-Motion Generation from Partially Annotated Data},
  author = {Mingdian Liu and Yilin Liu and Gurunandan Krishnan and Karl S Bayer and Bing Zhou},
  journal= {arXiv preprint arXiv:2409.13251},
  year   = {2024}
}

备注

10 pages, 4 figures, conference paper