对大型视觉-语言模型少样本适应的深入审视
计算机视觉与模式识别
2024-03-27 v2
摘要
高效迁移学习(ETL)正受到越来越多的关注,用于在少量标注样本的下游任务上适应大型预训练语言-视觉模型。尽管取得了显著进展,但我们揭示了最先进的ETL方法仅在狭义定义的实验设置中表现出强大性能,并且需要基于大量标注样本仔细调整超参数。特别地,我们有两个有趣且令人惊讶的实证观察。首先,为了超越简单的线性探测基线,这些方法需要在每个目标任务上优化其超参数。其次,在存在分布漂移的情况下,它们通常表现不如——有时甚至远不如——标准的零样本预测。受现有文献中不切实际假设(即访问大型验证集和针对最优超参数的案例特定网格搜索)的启发,我们提出了一种满足现实场景需求的新方法。更具体地说,我们引入了一种类别自适应线性探测(CLAP)目标,其平衡项通过适应此上下文的通用增广拉格朗日方法进行优化。我们在广泛的数据集和场景上全面评估了CLAP,证明它始终优于最先进的方法,同时是一种更高效的替代方案。
引用
@article{arxiv.2312.12730,
title = {A Closer Look at the Few-Shot Adaptation of Large Vision-Language Models},
author = {Julio Silva-Rodríguez and Sina Hajimiri and Ismail Ben Ayed and Jose Dolz},
journal= {arXiv preprint arXiv:2312.12730},
year = {2024}
}
备注
CVPR 2024. Code: https://github.com/jusiro/CLAP