中文

SgVA-CLIP:用于少样本图像分类的视觉语言模型语义引导视觉适配

计算机视觉与模式识别 2023-01-23 v2 多媒体

摘要

尽管少样本学习已取得显著进展,现有大多数少样本图像分类方法需要在大量基类样本上进行有监督预训练,这限制了它们在现实世界应用中的泛化能力。近来,大规模视觉-语言预训练模型(VLPs)因能利用网络上易获取文本为可迁移视觉表示学习提供新范式,而在少样本学习中受到越来越多的关注。然而,VLPs可能忽略难以用语言句子描述的细节视觉信息,而这些信息对于学习有效分类器以区分不同图像十分重要。为解决上述问题,我们提出了一个名为语义引导视觉适配(SgVA)的新框架,它能通过综合使用隐式知识蒸馏、视觉特定对比损失和跨模态对比损失,有效扩展视觉-语言预训练模型以产生具有判别力的适配视觉特征。隐式知识蒸馏旨在将细粒度跨模态知识迁移以引导视觉适配器的更新。在13个数据集上的SOTA结果表明,适配后的视觉特征能很好地补充跨模态特征,从而改进少样本图像分类。

关键词

引用

@article{arxiv.2211.16191,
  title  = {SgVA-CLIP: Semantic-guided Visual Adapting of Vision-Language Models for Few-shot Image Classification},
  author = {Fang Peng and Xiaoshan Yang and Linhui Xiao and Yaowei Wang and Changsheng Xu},
  journal= {arXiv preprint arXiv:2211.16191},
  year   = {2023}
}