中文

MA-FSAR:面向少样本动作识别的 CLIP 多模态适配框架

计算机视觉与模式识别 2024-10-07 v2

摘要

将 CLIP 等大规模视觉-语言预训练模型应用于少样本动作识别(FSAR)可显著提升性能与效率。尽管若干研究已认识到该优势,但其中多数采用全参数微调使 CLIP 的视觉编码器适配 FSAR 数据,这不仅计算开销高,还忽视了视觉编码器直接参与时序建模并聚焦于目标语义的潜力。为解决这些问题,我们提出 MA-FSAR,一种采用参数高效微调(PEFT)技术以增强 CLIP 视觉编码器在动作相关时序与语义表征方面的框架。我们的方案涉及细粒度多模态适配,不同于以往在常规动作识别中 PEFT 的尝试。具体而言,我们首先插入仅接收类令牌的全局时序适配模块,以高效捕获全局运动线索。随后这些输出与视觉令牌融合,通过局部多模态适配增强局部时序动态,该适配引入 FSAR 支撑集分支特有的文本特征以突出与动作相关的细粒度语义。除这些令牌级设计外,我们提出原型级文本引导构建模块,以进一步丰富视频原型的时序与语义特征。大量实验表明,我们以极少的可训练参数在各种任务中取得了优越性能。

关键词

引用

@article{arxiv.2308.01532,
  title  = {MA-FSAR: Multimodal Adaptation of CLIP for Few-Shot Action Recognition},
  author = {Jiazheng Xing and Chao Xu and Mengmeng Wang and Guang Dai and Baigui Sun and Yong Liu and Jingdong Wang and Jian Zhao},
  journal= {arXiv preprint arXiv:2308.01532},
  year   = {2024}
}