利用类别名称与视觉-语言模型进行小样本分类
计算机视觉与模式识别
2023-04-20 v3
摘要
在大规模数据上预训练的视觉-语言基础模型为许多视觉理解任务提供了强大的工具。值得注意的是,许多视觉-语言模型构建了两个编码器(视觉和文本),可以将两种模态映射到同一个嵌入空间中。因此,所学到的表示在图像分类等任务上取得了良好的零样本性能。然而,当每个类别只有少量样本时,大型视觉-语言模型的潜力往往无法充分发挥,这主要是由于大量参数与相对较少的训练数据之间存在差距。本文表明,我们可以通过使用类别名称来初始化分类头,从而显著提升小样本分类的性能。采用所提出的类别名称初始化方法,我们的模型在多个小样本图像分类基准上取得了最先进的性能(例如,在 ImageNet 上为 87.37%,在 Stanford Cars 上为 96.08%,均使用五样本学习)。
引用
@article{arxiv.2211.16594,
title = {Exploiting Category Names for Few-Shot Classification with Vision-Language Models},
author = {Taihong Xiao and Zirui Wang and Liangliang Cao and Jiahui Yu and Shengyang Dai and Ming-Hsuan Yang},
journal= {arXiv preprint arXiv:2211.16594},
year = {2023}
}