中文

FG-MDM:通过 ChatGPT 精炼描述实现零样本人体动作生成

计算机视觉与模式识别 2024-12-06 v3

摘要

近年来,基于文本的动作生成取得了显著进展,能够生成符合文本描述的多样化高质量人体动作。然而,生成超出原始数据集分布的动作(即零样本生成)仍然具有挑战性。通过采用分治策略,我们提出了一种名为细粒度人体动作扩散模型(FG-MDM)的新框架,用于零样本人体动作生成。具体而言,我们首先利用大型语言模型将以往模糊的文本标注解析为不同身体部位的细粒度描述。然后,我们使用这些细粒度描述来指导一个基于 Transformer 的扩散模型,该模型进一步采用了部位令牌的设计。由于描述更贴近动作本质,FG-MDM 能够生成超出原始数据集范围的人体动作。我们的实验结果证明了 FG-MDM 在零样本设置下相较于以往方法的优越性。我们将发布针对 HumanML3D 和 KIT 数据集的细粒度文本标注。

关键词

引用

@article{arxiv.2312.02772,
  title  = {FG-MDM: Towards Zero-Shot Human Motion Generation via ChatGPT-Refined Descriptions},
  author = {Xu Shi and Wei Yao and Chuanchen Luo and Junran Peng and Hongwen Zhang and Yunlian Sun},
  journal= {arXiv preprint arXiv:2312.02772},
  year   = {2024}
}

备注

Project Page: https://sx0207.github.io/fg-mdm/