大型语言模型对人类运动了解多少?以3D虚拟人控制为例
计算机视觉与模式识别
2025-09-23 v2 人工智能
计算与语言
机器人学
摘要
我们通过 3D 虚拟人控制探索大型语言模型 (Large Language Models, LLMs) 的人类运动知识。给定一条运动指令,我们提示 LLM 首先生成包含连续步骤的高层运动规划 (High-level Planning),然后指定每个步骤中的身体部位位置 (Low-level Planning),并将其线性插值为虚拟人动画。使用 20 条涵盖基本运动且平衡身体部位使用的代表性运动指令,我们进行了全面评估,包括对高层运动规划和生成动画的人工与自动评分,以及在低层规划中与基准位置的自动比较。我们的发现表明,LLM 擅长解释高层身体运动,但在精确的身体部位定位上存在困难。虽然将运动查询分解为原子组件改善了规划,但 LLM 在处理涉及高自由度身体部位的多步运动时面临挑战。此外,LLM 能为一般空间描述提供合理的近似,但在处理精确空间规范时表现不佳。值得注意的是,LLM 在构思创造性运动和区分具有文化特异性的运动模式方面展现出潜力。
引用
@article{arxiv.2505.21531,
title = {How Much Do Large Language Models Know about Human Motion? A Case Study in 3D Avatar Control},
author = {Kunhang Li and Jason Naradowsky and Yansong Feng and Yusuke Miyao},
journal= {arXiv preprint arXiv:2505.21531},
year = {2025}
}