检索增强的视觉提示学习用于小样本分类
计算机视觉与模式识别
2024-11-22 v3
摘要
对比语言-图像预训练(CLIP)模型已被广泛应用于各类下游视觉任务中。小样本学习范式被广泛采用以增强其在这些任务上的能力。然而,由于领域差距扩大,当前范式在细粒度分类(如卫星图像识别)上可能表现不佳。为应对此局限,我们提出检索增强的视觉提示学习(RePrompt),其引入检索机制来缓存并复用下游任务的知识。RePrompt 利用训练样本或可用的外部数据构建检索数据库,并使用检索机制增强简单提示学习基线的多个阶段,从而缩小领域差距。在推理时,我们增强后的模型可参考检索带来的相似样本以作出更准确的预测。详细分析表明,检索有助于改善深层特征的分布,进而提升下游任务的泛化能力。Reprompt 在广泛的视觉数据集上取得了最先进的性能,包括 11 个图像数据集、3 个视频数据集、1 个多视角数据集和 4 个领域泛化基准。
引用
@article{arxiv.2306.02243,
title = {Retrieval-Enhanced Visual Prompt Learning for Few-shot Classification},
author = {Jintao Rong and Hao Chen and Linlin Ou and Tianxiao Chen and Xinyi Yu and Yifan Liu},
journal= {arXiv preprint arXiv:2306.02243},
year = {2024}
}