知识即力量:利用多模态大语言模型的语义推进少样本动作识别
计算机视觉与模式识别
2026-03-30 v1
摘要
多模态大语言模型(MLLMs)推动了少样本动作识别(FSAR)领域的发展。然而,该领域的初步探索主要关注于生成标题以形成次优的特征->标题->特征流水线,并且仅在视觉空间内采用度量学习。在本文中,我们提出 FSAR-LLaVA,这是首个利用 MLLMs(如 Video-LLaVA)作为多模态知识库直接增强 FSAR 的端到端方法。首先,在特征层面,我们利用 MLLM 的多模态解码器提取时空和语义丰富的表示,然后通过我们的多模态特征增强模块将其解耦并增强为不同的视觉和文本特征,充分利用其语义知识服务于 FSAR。接下来,我们利用 MLLM 的多功能性来构建灵活适应多样化场景的输入提示,并利用其对齐输出来驱动我们设计的复合任务导向原型构建,有效弥合元训练集与元测试集之间的分布差距。最后,为了实现多模态特征联合指导度量学习,我们引入了一种无需训练的跨模态原型匹配度量,自适应选择最具决定性的线索,并高效利用 MLLMs 产生的解耦特征表示。大量实验证明了该方法在多种任务上以最少可训练参数取得了优越性能。
引用
@article{arxiv.2603.26033,
title = {Knowledge is Power: Advancing Few-shot Action Recognition with Multimodal Semantics from MLLMs},
author = {Jiazheng Xing and Chao Xu and Hangjie Yuan and Mengmeng Wang and Jun Dan and Hangwei Qian and Yong Liu},
journal= {arXiv preprint arXiv:2603.26033},
year = {2026}
}