LaMoGen:通过 LLM 指导的符号推理实现语言到运动生成
计算机视觉与模式识别
2026-03-13 v1
摘要
人类运动高度具表达性且自然对应于语言,但依赖大量关节文本运动嵌入的方法在合成具有准确时序性和细节的运动方面常常受限,且缺乏可解释性。为克服这些限制,我们提出 LabanLite,这是一种通过改编和扩展 Labanotation 系统而开发的运动表示方法。与黑盒文本运动嵌入不同,LabanLite 将每个原子身体部位动作(例如一步左脚)编码为离散的 Laban 符号配以文本模板。这种抽象将复杂运动分解为可解释的符号序列和身体部位指令,建立了高级语言与低级运动轨迹之间的符号联系。基于 LabanLite,我们提出 LaMoGen,一种将文本转换为 LabanLite 再到运动的生成框架,使大型语言模型 (LLM) 能够通过符号推理构成运动序列。LLM 解释运动模式,关联文本描述,并将符号重新组合为可执行计划,产生可解释且语言导向的运动。为支持严格评估,我们引入基于 Labanotation 的基准,包含结构化描述-运动配对,以及三个度量,联合衡量文本运动在符号、时序和和谐维度上的对齐。实验表明,LaMoGen 在可解释性和可控性方面建立了新的基准,对本基准和两个公开数据集均取得优异性能。这些结果凸显了符号推理和基于智能体设计在语言驱动运动合成中的优势。
引用
@article{arxiv.2603.11605,
title = {LaMoGen: Language to Motion Generation Through LLM-Guided Symbolic Inference},
author = {Junkun Jiang and Ho Yin Au and Jingyu Xiang and Jie Chen},
journal= {arXiv preprint arXiv:2603.11605},
year = {2026}
}
备注
Accepted by CVPR 2026. Supplementary material included. Project page: https://jjkislele.github.io/LaMoGen/