中文

基于描述生成基础模型的少样本动作识别

计算机视觉与模式识别 2023-10-17 v1

摘要

将预训练多模态基础模型中的视觉-语言知识迁移至各类下游任务是一个有前景的方向。然而,由于标注额外文本描述成本高昂,当前多数少样本动作识别方法仍局限于单一视觉模态输入。本文提出一种有效即插即用框架 CapFSAR,以利用多模态模型知识而无需人工标注文本。具体而言,我们首先利用描述生成基础模型(即 BLIP)提取视觉特征并为输入视频自动生成相应描述。随后,我们将文本编码器应用于合成描述以获得具代表性的文本嵌入。最后,进一步设计基于 Transformer 的视觉-文本聚合模块,以融合跨模态时空互补信息用于可靠的少样本匹配。借此,CapFSAR 可受益于预训练基础模型的强大多模态知识,从而在低样本情形下获得更全面的分类。在多个标准少样本基准上的大量实验表明,所提 CapFSAR 优于现有方法并取得最先进性能。代码将公开可用。

关键词

引用

@article{arxiv.2310.10125,
  title  = {Few-shot Action Recognition with Captioning Foundation Models},
  author = {Xiang Wang and Shiwei Zhang and Hangjie Yuan and Yingya Zhang and Changxin Gao and Deli Zhao and Nong Sang},
  journal= {arXiv preprint arXiv:2310.10125},
  year   = {2023}
}