两阶段视角下重新思考视觉-语言模型的少样本自适应
计算机视觉与模式识别
2025-03-17 v1 机器学习
多媒体
摘要
训练分类器的一种经典方法是 先学习一个良好的特征提取器,再在其上优化一个线性层。当每个类别只有少量样本可用时(如少样本自适应,Few-Shot Adaptation, FSA),数据不足以拟合大量参数,使得上述方法变得不切实际。对于大型预训练视觉-语言模型(Vision-Language Models, VLMs)而言尤其如此,这推动了参数高效微调(Parameter-Efficient Fine-tuning, PEFT)与 FSA 交叉领域的成功研究。在本工作中,我们首先分析了仅在部分类别(称为“基类”)的少样本数据上训练 PEFT 技术时的学习动态。我们表明,这种动态自然地分为两个不同的阶段: 任务级特征提取,以及 对可用概念的专业化。为了适应这种动态,我们摒弃了基于提示或适配器的方法,以不同的方式处理 FSA。具体而言,在固定的计算预算下,我们将其分配为 通过 PEFT 学习特定于任务的特征提取器,以及 在其上训练一个线性分类器。我们将此方案称为两阶段少样本自适应(Two-Stage Few-Shot Adaptation, 2SFS)。与现有方法不同,我们的方案在类别级别上实现了一种新颖的选择性推理形式,即在测试时,只有新类被适配后的文本编码器嵌入,而基类的嵌入在分类器内部即可获取。在两种设置、三个主干网络和十一个数据集上使用固定超参数的结果表明,2SFS 匹配或超越了现有技术水平(SOTA),而已有方法在不同设置下性能显著下降。
引用
@article{arxiv.2503.11609,
title = {Rethinking Few-Shot Adaptation of Vision-Language Models in Two Stages},
author = {Matteo Farina and Massimiliano Mancini and Giovanni Iacca and Elisa Ricci},
journal= {arXiv preprint arXiv:2503.11609},
year = {2025}
}
备注
Camera-ready version for CVPR 2025 (w/ SuppMat, 23 pages)