基于描述生成基础模型的少样本动作识别
计算机视觉与模式识别
2023-10-17 v1
摘要
将预训练多模态基础模型中的视觉-语言知识迁移至各类下游任务是一个有前景的方向。然而,由于标注额外文本描述成本高昂,当前多数少样本动作识别方法仍局限于单一视觉模态输入。本文提出一种有效即插即用框架 CapFSAR,以利用多模态模型知识而无需人工标注文本。具体而言,我们首先利用描述生成基础模型(即 BLIP)提取视觉特征并为输入视频自动生成相应描述。随后,我们将文本编码器应用于合成描述以获得具代表性的文本嵌入。最后,进一步设计基于 Transformer 的视觉-文本聚合模块,以融合跨模态时空互补信息用于可靠的少样本匹配。借此,CapFSAR 可受益于预训练基础模型的强大多模态知识,从而在低样本情形下获得更全面的分类。在多个标准少样本基准上的大量实验表明,所提 CapFSAR 优于现有方法并取得最先进性能。代码将公开可用。
引用
@article{arxiv.2310.10125,
title = {Few-shot Action Recognition with Captioning Foundation Models},
author = {Xiang Wang and Shiwei Zhang and Hangjie Yuan and Yingya Zhang and Changxin Gao and Deli Zhao and Nong Sang},
journal= {arXiv preprint arXiv:2310.10125},
year = {2023}
}