中文

先思后动:面向文本到动作生成的隐式运动推理

计算机视觉与模式识别 2026-01-01 v1

摘要

当前最先进的范式主要将文本到动作(Text-to-Motion, T2M)生成视为一个直接翻译问题,即将符号语言直接映射到连续姿态。虽然这种方法对简单动作有效,但这种系统 1 方法面临一个我们称之为语义-运动学阻抗失配(Semantic-Kinematic Impedance Mismatch)的根本性理论瓶颈:即一次性将语义密集、离散的语言意图落实到运动学密集、高频的运动数据的内在困难。在本文中,我们认为解决方案在于向隐式系统 2 推理的架构转变。受认知科学中层次运动控制(Hierarchical Motor Control)的启发,我们提出了隐式运动推理(Latent Motion Reasoning, LMR),它将生成重新表述为一个“先思后动”的两阶段决策过程。LMR 的核心是一种新颖的双粒度分词器(Dual-Granularity Tokenizer),它将运动解耦到两个不同的流形上:一个压缩的、语义丰富的推理隐空间(Reasoning Latent),用于规划全局拓扑;以及一个高频的执行隐空间(Execution Latent),用于保持物理保真度。通过强制模型在“动”(实例化帧)之前进行自回归“思”(规划粗略轨迹),我们有效地弥合了语言与物理之间的不可言说鸿沟。我们通过将 LMR 应用于两个代表性基线模型:T2M-GPT(离散)和 MotionStreamer(连续),展示了其多功能性。大量实验表明,LMR 在语义对齐和物理合理性方面都带来了非平凡的提升,验证了运动规划的最佳基质不是自然语言,而是一个学习到的、与运动对齐的概念空间。代码和演示可在 \hyperlink{https://chenhaoqcdyq.github.io/LMR/}{https://chenhaoqcdyq.github.io/LMR/} 找到。

关键词

引用

@article{arxiv.2512.24100,
  title  = {Think Before You Move: Latent Motion Reasoning for Text-to-Motion Generation},
  author = {Yijie Qian and Juncheng Wang and Yuxiang Feng and Chao Xu and Wang Lu and Yang Liu and Baigui Sun and Yiqiang Chen and Yong Liu and Shujun Wang},
  journal= {arXiv preprint arXiv:2512.24100},
  year   = {2026}
}

备注

project page: https://chenhaoqcdyq.github.io/LMR/