中文

CLIP引导的原型调制用于少样本动作识别

计算机视觉与模式识别 2024-10-28 v1

摘要

近来,从CLIP等大规模对比语言-图像预训练中学习已在广泛下游任务中展现出显著成功,但在具挑战性的少样本动作识别(FSAR)任务上仍待探索。本工作中,我们旨在迁移CLIP强大的多模态知识,以缓解因数据稀缺导致的原型估计不准确问题,这是低样本机制中的关键问题。为此,我们提出一种称为CLIP-FSAR的CLIP引导原型调制框架,其包含两个关键组件:视频-文本对比目标与原型调制。具体而言,前者通过对比视频与相应类别文本描述,弥合CLIP与少样本视频任务间的任务差异。后者利用CLIP中可迁移的文本概念,通过时序Transformer自适应精炼视觉原型。借此,CLIP-FSAR可充分利用CLIP中丰富语义先验获得可靠原型并实现准确少样本分类。在五个常用基准上的大量实验证明了我们所提方法的有效性,且CLIP-FSAR在各种设置下显著优于现有最先进(SOTA)方法。源代码与模型将公开于 https://github.com/alibaba-mmai-research/CLIP-FSAR。

关键词

引用

@article{arxiv.2303.02982,
  title  = {CLIP-guided Prototype Modulating for Few-shot Action Recognition},
  author = {Xiang Wang and Shiwei Zhang and Jun Cen and Changxin Gao and Yingya Zhang and Deli Zhao and Nong Sang},
  journal= {arXiv preprint arXiv:2303.02982},
  year   = {2024}
}

备注

This work has been submitted to the Springer for possible publication