中文

检索增强的视觉提示学习用于小样本分类

计算机视觉与模式识别 2024-11-22 v3

摘要

对比语言-图像预训练(CLIP)模型已被广泛应用于各类下游视觉任务中。小样本学习范式被广泛采用以增强其在这些任务上的能力。然而,由于领域差距扩大,当前范式在细粒度分类(如卫星图像识别)上可能表现不佳。为应对此局限,我们提出检索增强的视觉提示学习(RePrompt),其引入检索机制来缓存并复用下游任务的知识。RePrompt 利用训练样本或可用的外部数据构建检索数据库,并使用检索机制增强简单提示学习基线的多个阶段,从而缩小领域差距。在推理时,我们增强后的模型可参考检索带来的相似样本以作出更准确的预测。详细分析表明,检索有助于改善深层特征的分布,进而提升下游任务的泛化能力。Reprompt 在广泛的视觉数据集上取得了最先进的性能,包括 11 个图像数据集、3 个视频数据集、1 个多视角数据集和 4 个领域泛化基准。

关键词

引用

@article{arxiv.2306.02243,
  title  = {Retrieval-Enhanced Visual Prompt Learning for Few-shot Classification},
  author = {Jintao Rong and Hao Chen and Linlin Ou and Tianxiao Chen and Xinyi Yu and Yifan Liu},
  journal= {arXiv preprint arXiv:2306.02243},
  year   = {2024}
}