LLaVAction:评估与训练多模态大语言模型以进行动作理解
计算机视觉与模式识别
2026-01-27 v2
摘要
理解人类行为需要衡量行为动作。由于其复杂性,行为最好映射到语言等丰富语义结构上。新兴的多模态大语言模型(MLLMs)是具有前景的候选人,但其细粒度动作理解能力尚未得到充分检验。在本工作中,我们将一个由最大且最具挑战性的以人身为中心的动作识别数据集(EPIC-KITCHENS-100)重新格式化为MLLMs基准测试(EPIC-KITCHENS-100-MQA)。我们展示,当我们基于专家模型作为干扰项采样困难答案时,领先的MLLMs难以识别正确的动作。我们如何提高MLLMs的性能呢?我们精选了一个监督微调数据集,包括“困难”动作识别、时间检测、描述和自由问答,以提高模型在多样化动作理解能力方面的表现。我们引入了一个名为LLaVAction的新模型,通过添加动作标记来提升模型对视觉标记的注意力,并采用两阶段管道以获得结构化动作。LLaVAction显著提高了MLLMs进行动作理解的能力,在两个MLLMs基准测试(在EPIC-KITCHENS-100-MQA上相对于GPT-4o提升21分)和既定动作识别基准测试方面取得了显著的改进,表明我们的技术为MLLMs在复杂动作任务中走上前进之路提供了广阔希望。代码、数据、基准测试和模型均可在https://github.com/AdaptiveMotorControlLab/LLaVAction获取。
引用
@article{arxiv.2503.18712,
title = {LLaVAction: evaluating and training multi-modal large language models for action understanding},
author = {Haozhe Qi and Shaokai Ye and Alexander Mathis and Mackenzie W. Mathis},
journal= {arXiv preprint arXiv:2503.18712},
year = {2026}
}
备注
https://github.com/AdaptiveMotorControlLab/LLaVAction