中文

MotionMERGE:面向人类运动编辑、推理、生成与解释的多粒度框架

计算机视觉与模式识别 2026-05-20 v1

摘要

最近的运动语言模型统一了理解与生成等任务,但 operates at 粗粒度,缺乏对身体部位所需的细粒度理解和细致控制。这种现象源于模型与数据中的根本问题:模型无法聚焦于运动的局部模式,训练数据缺乏细粒度监督。为此,我们提出 MotionMERGE,一个弥合粒度差距的统一框架。首先,我们首次系统性地研究细粒度语言引导的运动控制,包括详细理解和局部编辑,通过在单个大语言模型中显式建模运动的部件和时间层级,赋予模型对精确控制的稳健先验。其次,我们设计了推理感知的粒度协同预训练策略,采用联合监督实现跨粒度对齐、时间定位、局部对齐、运动一致性和运动导因的链式思考推理。这一方法赋予模型细粒度运动-语言对齐、跨粒度协同和显式推理能力。最后,我们策划了 MotionFineEdit 数据集,包含 83.7 万原子级样本和 14.4 万复杂样本,首次包含细粒度时空纠正指令和运动导因的链式思考标注,建立了细粒度文本驱动运动编辑和运动导因推理的新基准。大量实验表明,MotionMERGE 在更精确的运动生成、理解和编辑方面具有优势,并展现出对其他复杂运动任务的强大零样本泛化能力。这一工作标志着模型与人类运动进行更细粒度交互和类人推理的重要一步。

关键词

引用

@article{arxiv.2605.18956,
  title  = {MotionMERGE: A Multi-granular Framework for Human Motion Editing, Reasoning, Generation, and Explanation},
  author = {Bizhu Wu and Jinheng Xie and Wenting Chen and Zhe Kong and Jianfeng Ren and Linlin Shen and Ruibin Bai and Rong Qu},
  journal= {arXiv preprint arXiv:2605.18956},
  year   = {2026}
}