中文

面向少样本图像分类的视觉-语义对比对齐

计算机视觉与模式识别 2022-10-21 v1

摘要

少样本学习旨在训练并优化一个模型,使其仅借助少量标注样本即可适应未见过的视觉类别。现有的少样本学习(FSL)方法严重依赖纯视觉数据,因而无法捕捉语义属性,以从极少量样本中学习更具泛化性的视觉概念。然而,众所周知,人类的视觉学习极大受益于视觉、语言和音频等多模态输入。受人类将语言形式的某视觉类别已有知识加以封装的学习本质启发,我们引入一种针对视觉与语义特征向量的对比对齐机制,以学习更具泛化性的少样本视觉概念。我们的方法仅添加一个辅助对比学习目标,在现有训练机制之外,从强大的文本编码器中捕捉视觉类别的上下文知识。因此,该方法更具通用性,可插入任意现有 FSL 方法中。我们在方法中使用的预训练语义特征提取器(从大规模文本语料中学习)提供了强大的上下文先验知识以辅助 FSL。在主流 FSL 数据集上的实验结果表明,我们的方法具有通用性,并能显著增强现有 FSL 基线。

关键词

引用

@article{arxiv.2210.11000,
  title  = {Visual-Semantic Contrastive Alignment for Few-Shot Image Classification},
  author = {Mohamed Afham and Ranga Rodrigo},
  journal= {arXiv preprint arXiv:2210.11000},
  year   = {2022}
}

备注

ECCV 2022 Workshop on Computer Vision in the Wild