中文

重思 few-shot CLIP 框架:归纳设置下的批判性分析

计算机视觉与模式识别 2025-07-29 v1

摘要

CLIP 是一种在 few-shot 设置下具有可迁移分类性能的基础模型。Several 方法已显示在 few-shot 示例中提高 CLIP 的性能。然而,这些技术都使用标准 few-shot 数据集进行基准测试。我们认为,这种评估模式并不能提供使用 few-shot 示例进行归纳一般化能力的真实指示。由于大多数数据集已被 CLIP 模型看到,所谓的设置可称为部分诱导性。为解决此问题,我们提出一个管道使用 unlearning 技术获取真正的归纳基线。在新归纳设置下,所述方法显示出显著的性能下降(在 13 个基线中平均下降 -55%)。我们通过 oracle 基线验证了 unlearning 技术。提出了一种改进的 few-shot 分类技术,在综合分析中始终在 5880 个实验中获得 SOTA 水平——这些实验变化数据集、不同的 few-shot 示例数量、unlearning 设置以及不同随机种子。因此,我们识别了 CLIP-based few-shot 分类评估的问题,提供了使用 unlearning 的解决方案,提出了新的基准,并提供了一种改进的方法。

关键词

引用

@article{arxiv.2507.20834,
  title  = {Rethinking Few Shot CLIP Benchmarks: A Critical Analysis in the Inductive Setting},
  author = {Alexey Kravets and Da Chen and Vinay P. Namboodiri},
  journal= {arXiv preprint arXiv:2507.20834},
  year   = {2025}
}