中文

人类运动指令调优

人工智能 2025-03-27 v4 计算机视觉与模式识别

摘要

本文提出了LLaMo(Large Language and Human Motion Assistant),一种用于人类运动指令调优的多模态框架。与常规指令调优方法不同,后者将非语言输入(如视频或运动序列)转换为语言标记,而LLaMo保留运动的原始形式进行指令调优。该方法保留了运动特定细节,这些细节在标记化过程中常被削弱,从而提高了模型解释复杂人类行为的能力。通过处理视频和运动数据以及文本输入,LLaMo实现了灵活的人类中心分析。跨越高复杂度领域的实验评估,包括人类行为和专业活动,表明LLaMo有效捕获了领域特定知识,增强了运动密集场景中的理解和预测能力。我们希望LLaMo为未来具有广泛应用前景的多模态AI系统提供基础,从体育分析到行为预测。我们的代码和模型已在项目网站 https://github.com/ILGLJ/LLaMo 提供。

关键词

引用

@article{arxiv.2411.16805,
  title  = {Human Motion Instruction Tuning},
  author = {Lei Li and Sen Jia and Jianhao Wang and Zhongyu Jiang and Feng Zhou and Ju Dai and Tianfang Zhang and Zongkai Wu and Jenq-Neng Hwang},
  journal= {arXiv preprint arXiv:2411.16805},
  year   = {2025}
}

备注

Accepted by CVPR 2025