通过多选问题提升零样本图像分类性能
机器学习
2024-07-24 v1 计算机视觉与模式识别
摘要
通过简单的多选语言提示,VQA模型可作为零样本图像分类器,产生分类标签。与典型图像编码器相比,VQA模型具有优势:VQA生成的图像嵌入可通过量身定制的语言提示融入最相关的视觉信息。然而,对于大多数任务,零样本VQA性能不佳,可能是由于不熟悉的类别名称或预训练数据与测试数据分布不一致。我们提出一种简单方法,通过仅少量标记示例和多选问题来提升VQA用于图像分类的性能。该few-shot方法无需训练,保持了VQA模型的动态和灵活优势。我们不依赖最终语言输出,而是使用多选问题提取特定提示的潜在表示,这些表示被丰富的相关视觉信息所增强。这些表示被组合以创建最终的整体图像嵌入,依据从少量标记示例中构建的类原型进行解码。我们在MiniImageNet、Caltech-UCSD鸟类和CIFAR-100等常见few-shot任务上Demonstrate该方法优于纯视觉编码器和零样本VQA基线,取得令人印象深刻的性能。最后,我们表明该方法在大量多样化视觉属性(如服装的面料、文章样式、纹理和不同文章的视角)的情境下表现尤佳,而其他few-shot方法在那里会感到困难,因为我们可以仅针对感兴趣的语义特征来定制图像表示。
关键词
引用
@article{arxiv.2407.16145,
title = {Improved Few-Shot Image Classification Through Multiple-Choice Questions},
author = {Dipika Khullar and Emmett Goodman and Negin Sokhandan},
journal= {arXiv preprint arXiv:2407.16145},
year = {2024}
}