中文

Motion-R1:基于分解链思与 RL 绑定增强运动生成

计算机视觉与模式识别 2025-11-25 v4

摘要

文本到运动生成已成为人机交互中的基础任务,使人类能够从自然语言描述中合成逼真的人类动作。尽管近期在大型语言模型和强化学习方面的进展为高质量运动生成作出了贡献,但仍存在两个主要挑战。现有方法往往未能捕捉自然语言中固有的时序性和因果性,导致生成的运动过于简化或不连贯。此外,基于 RL 的方法常常过于复杂,阻碍其在各种运动生成任务中的可扩展性和适应性。为此,我们提出Motion-R1,一种新型框架,将分解链思推理与强化学习结合,以增强生成运动的质量和可解释性。具体而言,我们引入分解CoT数据引擎,利用自动化管道合成高质量推理数据,使模型更好地捕捉人类动作的时序依赖性和因果关系。我们还提出了RL绑定,是一种将多模态文本-运动对齐纳入 RL 奖励函数的强化学习策略,引导模型生成既在语义上准确又在运动上真实可靠的运动。广泛的基准数据集实验表明,Motion-R1 在 HumanML3D 上的 MM-Dist 提升了3.5%,在 KIT-ML 和 BABEL 上的 R-Precision 和 FID 也实现了提升,凌超越现有方法,凸显了其在处理复杂运动生成任务方面的卓越能力。项目页面:https://motion-r1.github.io/。

关键词

引用

@article{arxiv.2506.10353,
  title  = {Motion-R1: Enhancing Motion Generation with Decomposed Chain-of-Thought and RL Binding},
  author = {Runqi Ouyang and Haoyun Li and Zhenyuan Zhang and Xiaofeng Wang and Zeyu Zhang and Zheng Zhu and Guan Huang and Sirui Han and Xingang Wang},
  journal= {arXiv preprint arXiv:2506.10353},
  year   = {2025}
}