中文

基于强化学习的学习可泛化人体运动生成器

计算机视觉与模式识别 2024-05-27 v1

摘要

文本驱动的人体运动生成,作为计算机辅助内容创作中的关键任务之一,近年来受到越来越多的关注。虽然开创性研究主要致力于提高给定数据集上的数值性能指标,但实际应用揭示了一个常见挑战:现有方法常常过拟合训练数据中的特定运动表达,阻碍了它们泛化到新颖描述(如未见过的运动组合)的能力。这种局限性限制了它们的更广泛应用。我们认为,上述问题主要源于可用的运动-文本对的稀缺性,考虑到文本驱动运动生成的“多对多”性质。为了解决这个问题,我们将文本到运动生成建模为马尔可夫决策过程,并提出了 **InstructMotion**,它结合了强化学习中的试错范式,用于可泛化的人体运动生成。利用对比预训练的文本和运动编码器,我们深入研究了奖励设计的优化,使InstructMotion能够在配对数据上有效运行,增强全局语义层面的文本-运动对齐,以及在合成的纯文本数据上运行,促进对新颖提示的更好泛化,而无需真实运动监督。在流行基准测试以及我们合成的非配对数据集上进行的大量实验表明,所提出的InstructMotion在定量和定性方面都取得了出色的性能。

关键词

引用

@article{arxiv.2405.15541,
  title  = {Learning Generalizable Human Motion Generator with Reinforcement Learning},
  author = {Yunyao Mao and Xiaoyang Liu and Wengang Zhou and Zhenbo Lu and Houqiang Li},
  journal= {arXiv preprint arXiv:2405.15541},
  year   = {2024}
}