分布偏移下少样本学习的提示调优视觉语言模型与边界正则化
计算机视觉与模式识别
2025-05-22 v1 机器学习
摘要
近年来,像CLIP和ALIGN这样在大规模数据上预训练的视觉语言基础模型,在面对不同类别甚至不同领域的数据集时展现出了显著的零样本泛化能力。在本工作中,我们进一步研究了这些模型是否能在仅使用目标数据集少量标注样本的情况下,适应与预训练数据分布和类别差异很大的目标数据集。在这种场景下,由于过拟合和泛化能力丧失的问题,微调大型预训练模型具有挑战性,且在先前文献中尚未得到充分探索。由于此类模型的预训练数据不可用,因此难以理解其在各种下游数据集上的性能。首先,我们尝试回答这个问题:给定一个仅有少量标注样本的目标数据集,能否通过分析公共视觉语言嵌入空间来估计进一步微调是否能提升性能相对于零样本评估的表现。基于该分析,我们提出了一种新颖的提示调优方法PromptMargin,用于直接在少量目标样本上适应此类大规模视觉语言模型。PromptMargin有效地对该任务的文本提示和视觉提示进行调优,并包含两个主要模块:1) 首先,我们使用选择性增强策略来补充每个任务中的少量训练样本;2) 此外,为确保在不熟悉类别名称存在的情况下稳健训练,我们通过一种新颖的多模态边界正则化器增加类间边界以提升类别区分度。在十五个目标基准数据集上的广泛实验和分析,这些数据集具有不同程度的分布偏移(从自然图像出发),展示了所提框架在该设置下相对于现有最先进方法的有效性。github.com/debarshigit/PromptMargin。
引用
@article{arxiv.2505.15506,
title = {Prompt Tuning Vision Language Models with Margin Regularizer for Few-Shot Learning under Distribution Shifts},
author = {Debarshi Brahma and Anuska Roy and Soma Biswas},
journal= {arXiv preprint arXiv:2505.15506},
year = {2025}
}
备注
Published in TMLR (2025)