基于阶段性检索增强微调的少样本识别
计算机视觉与模式识别
2025-03-25 v3 人工智能
机器学习
摘要
少样本识别(FSR)旨在仅使用每个概念的少数标记示例来训练分类模型,以满足下游任务的需求,其中数据标注成本可能高昂。我们开发了方法,通过利用预训练的视觉语言模型(VLM)来解决 FSR。我们特别探索了检索增强学习(RAL),即检索开放数据(例如 VLM 的预训练数据集)以学习更好地服务下游任务的模型。虽然 RAL 在零样本识别中已受到研究,但在 FSR 中仍未得到充分探索。尽管将 RAL 应用于 FSR 看似直接,但我们观察到有趣且新颖的挑战和机遇。首先,令人惊讶的是,在大量检索数据上对 VLM 进行微调会低于当前最先进的零样本方法。这是由于检索数据的不平衡分布以及其与下游任务中少数样本示例之间的领域差距所致。其次,令人惊讶的是,仅在少样本示例上对 VLM 进行微调会显著优于以前的 FSR 方法,对检索数据和少样本数据的混合进行微调效果更佳。为缓解不平衡分布和领域差距问题,我们提出了阶段性检索增强微调(SWAT),即在第一个阶段对混合数据进行端到端微调,并在第二个阶段对少样本数据重新训练分类器。广泛的实验在九个流行基准测试上表明,SWAT 在准确率上显著优于以前的方法(提升 >6%)。
引用
@article{arxiv.2406.11148,
title = {Few-Shot Recognition via Stage-Wise Retrieval-Augmented Finetuning},
author = {Tian Liu and Huixin Zhang and Shubham Parashar and Shu Kong},
journal= {arXiv preprint arXiv:2406.11148},
year = {2025}
}
备注
Accepted to CVPR 2025. Website and code: https://tian1327.github.io/SWAT/