面向少样本视觉语言模型的低秩适配
计算机视觉与模式识别
2024-06-04 v2
摘要
近期视觉语言模型(VLM)的少样本适配进展进一步推动了其泛化能力,代价是在目标下游任务中仅使用少量标记样本。然而,这一前景已相当丰富的少样本文献主要集中在提示学习上,对适配器的关注较少,甚至忽略了参数高效微调(PEFT)的最新进展。此外,现有的VLM少样本学习方法常依赖重型训练程序和/或精心挑选的任务特定超参数,这可能阻碍其实际应用。为此,我们在VLM的少样本学习中引入低秩适配(LoRA),并在与当前基于提示和适配器的方法进行比较后,展示了其潜力。在11个数据集上进行评估。令人惊讶的是,我们的简单CLIP-LoRA方法显示出显著的改进,同时缩短了训练时间,并在所有目标任务中保持相同的超参数,即跨所有数据集和样本数。当然,我们的惊人结果并不否定提示学习和适配器方法研究的潜力。然而,我们相信我们的强大基线可用于评估这些新兴主题在少样本VLM中的进展。
引用
@article{arxiv.2405.18541,
title = {Low-Rank Few-Shot Adaptation of Vision-Language Models},
author = {Maxime Zanella and Ismail Ben Ayed},
journal= {arXiv preprint arXiv:2405.18541},
year = {2024}
}