人类运动指令调优
人工智能
2025-03-27 v4 计算机视觉与模式识别
摘要
本文提出了LLaMo(Large Language and Human Motion Assistant),一种用于人类运动指令调优的多模态框架。与常规指令调优方法不同,后者将非语言输入(如视频或运动序列)转换为语言标记,而LLaMo保留运动的原始形式进行指令调优。该方法保留了运动特定细节,这些细节在标记化过程中常被削弱,从而提高了模型解释复杂人类行为的能力。通过处理视频和运动数据以及文本输入,LLaMo实现了灵活的人类中心分析。跨越高复杂度领域的实验评估,包括人类行为和专业活动,表明LLaMo有效捕获了领域特定知识,增强了运动密集场景中的理解和预测能力。我们希望LLaMo为未来具有广泛应用前景的多模态AI系统提供基础,从体育分析到行为预测。我们的代码和模型已在项目网站 https://github.com/ILGLJ/LLaMo 提供。
引用
@article{arxiv.2411.16805,
title = {Human Motion Instruction Tuning},
author = {Lei Li and Sen Jia and Jianhao Wang and Zhongyu Jiang and Feng Zhou and Ju Dai and Tianfang Zhang and Zongkai Wu and Jenq-Neng Hwang},
journal= {arXiv preprint arXiv:2411.16805},
year = {2025}
}
备注
Accepted by CVPR 2025