基于 LLM 推理和物理感知细化的开放词汇运动生成框架 Re$^2$MoGen
计算机视觉与模式识别
2026-04-21 v1 机器人学
摘要
文本到运动(Text-to-motion, T2M)生成旨在通过文本描述控制目标角色的行为。依赖文本-运动配对数据集,现有 T2M 模型已在生成训练数据分布内的高质量运动方面取得显著成绩。然而,当运动描述与训练文本有显著差异时,其性能会显著下降。为此,我们提出 ReMoGen,一种运动生成框架,通过增强型大型语言模型(LLM)推理生成初始运动计划,再通过强化学习(RL)后训练细化其物理可行性。具体而言,ReMoGen 包含三个阶段:首先,我们采用蒙特卡洛树搜索来增强 LLM 在仅指定根部和数个关键关节位置(以简化推理过程)的前提下,基于文本提示生成合理关键帧的推理能力。随后,我们将人体姿态模型作为先验,将基于计划关键帧的完整身体姿态优化,并利用所得不完整运动监督对预训练运动生成器进行微调,通过动态时序匹配目标实现时空完成。最后,我们使用基于物理的奖励进行后训练,以细化运动质量,消除 LLM 计划中的物理不可行性。广泛实验表明,该框架能够生成语义一致且物理上可行的运动,在开放词汇运动生成方面实现最先进的性能。
引用
@article{arxiv.2604.17807,
title = {Re$^2$MoGen: Open-Vocabulary Motion Generation via LLM Reasoning and Physics-Aware Refinement},
author = {Jiakun Zheng and Ting Xiao and Shiqin Cao and Xinran Li and Zhe Wang and Chenjia Bai},
journal= {arXiv preprint arXiv:2604.17807},
year = {2026}
}