中文

利用视觉语言大模型进行可解释视频动作识别:语义分词方法

计算机视觉与模式识别 2025-09-09 v1

摘要

人类动作识别常面临深层语义理解、复杂上下文信息和细粒度区分能力不足的问题,这些限制传统方法在处理多样化视频数据时经常遇到的。灵感来自大语言模型的卓越能力,本文引入了LVLM-VAR框架,首次将预训练视觉语言大模型 (LVLMs) 应用于视频动作识别,强调提高准确率和可解释性。我们的方法包含Video-to-Semantic-Tokens (VST) 模块,该模块创新性地将原始视频序列转换为离散的、在语义和时间上一致的"语义动作标记",有效构建了可被LVLMs理解的"动作叙事"。这些标记与自然语言指令一起输入到经过LoRA微调的LVLMs(如LLaVA-13B)进行稳健的动作分类和语义推理。LVLM-VAR不仅在诸如NTU RGB+D和NTU RGB+D 120等具有挑战性的基准测试中实现了最先进或高度竞争的性能(例如在NTU RGB+D X-Sub上达到94.1%,在NTU RGB+D 120 X-Set上达到90.0%),还通过生成对预测的自然语言解释,显著提升了模型的可解释性。

关键词

引用

@article{arxiv.2509.05695,
  title  = {Leveraging Vision-Language Large Models for Interpretable Video Action Recognition with Semantic Tokenization},
  author = {Jingwei Peng and Zhixuan Qiu and Boyu Jin and Surasakdi Siripong},
  journal= {arXiv preprint arXiv:2509.05695},
  year   = {2025}
}