UniMo:基于思维链的统一运动生成与理解
人工智能
2026-01-21 v1
摘要
现有的3D人体运动生成与理解方法通常可解释性有限,限制了这些本质相关任务之间的有效相互增强。虽然当前基于大语言模型(LLM)的统一框架利用了语言先验,但它们经常在语义对齐和任务一致性方面遇到挑战。此外,LLM中的下一个词元预测范式不适用于运动序列,会导致累积预测误差。为解决这些限制,我们提出了UniMo,一种新颖的框架,通过监督微调(SFT)将运动-语言信息和可解释的思维链(CoT)推理集成到LLM中。我们进一步引入了基于组相对策略优化(GRPO)的强化学习作为后训练策略,该策略对词元组进行优化以强制结构正确性和语义对齐,从而减轻运动词元预测中的累积误差。大量实验表明,UniMo显著优于现有的统一模型和特定任务模型,在运动生成和理解方面均达到了最先进的性能。
引用
@article{arxiv.2601.12126,
title = {UniMo: Unified Motion Generation and Understanding with Chain of Thought},
author = {Guocun Wang and Kenkun Liu and Jing Lin and Guorui Song and Jian Li and Xiaoguang Han},
journal= {arXiv preprint arXiv:2601.12126},
year = {2026}
}