无编码的人类运动理解:基于结构化运动描述
计算机视觉与模式识别
2026-05-28 v2
摘要
文本基准大型语言模型(LLM)的世界知识和推理能力正在快速发展,但当前的人类运动理解方法,包括运动问答和描述,尚未充分利用这些能力。现有LLM方法通常通过专用编码器将运动特征投影到LLM的嵌入空间,从而受限于跨模态表示和对齐。受生物力学分析启发,其中关节角度和身体部位运动动力学长期以来作为人类运动的精确描述语言,本文提出了结构化运动描述(Structured Motion Description, SMD),一种基于规则的、确定性的方法,将关节位置序列转换为关节角度、身体部位运动和全局轨迹的结构化自然语言描述。通过将运动表示为文本,SMD使LLM能够直接应用其预训练的身体部位、空间方向和运动语义知识进行运动推理,而无需学习编码器或对齐模块。我们表明,该方法超越了基于运动问答(BABEL-QA上达66.7%,HuMMan-QA上达90.1%)和运动描述(HumanML3D上R@1为0.584,CIDEr为53.16)的所有先前方法的结果。SMD还提供了实际优势:相同文本输入可跨越不同的LLM,仅需轻量级LoRA适配(在8个来自6个模型家族的LLM上验证),其人类可读表示使对运动描述的注意力分析具有可解释性。代码、数据和预训练LoRA适配器均可在 https://yaozhang182.github.io/motion-smd/ 获取。
引用
@article{arxiv.2604.21668,
title = {Encoder-Free Human Motion Understanding via Structured Motion Descriptions},
author = {Yao Zhang and Zhuchenyang Liu and Thomas Ploetz and Yu Xiao},
journal= {arXiv preprint arXiv:2604.21668},
year = {2026}
}