ProKeR:大视觉语言模型少样本适应的核方法视角
计算机视觉与模式识别
2025-01-22 v1 人工智能
机器学习
摘要
对比式语言-图像预训练 (CLIP) 的日益流行导致其在各种视觉下游任务中得到广泛应用。为了提高 CLIP 的效果和通用性,已广泛采用高效的少样本适应技术。其中,训练无关的方法,特别是以 Tip-Adapter 为代表的缓存方法,因无需额外微调而受到关注。在本文中,我们从核的角度重新审视 Tip-Adapter,表明缓存方法作为局部适配器,与已建立的核文献相连接。基于这一洞见,我们提供了这些方法运行机制的理论理解,并提出了多种改进 Tip-Adapter 基准的方法的途径。值得注意的是,我们的分析表明,在局部适配器中 Incorporating 全局信息至关重要。因此,我们随后提出了一种全局方法,通过在再生产核希尔伯特空间 (RKHS) 中学习一个接近正则化器,以 CLIP 作为基础学习器。我们称之为 ProKeR(Proximal Kernel ridge Regression),该方法具有闭式解,并在标准少样本适应基准中的 11 个数据集上实现最先进的性能。
引用
@article{arxiv.2501.11175,
title = {ProKeR: A Kernel Perspective on Few-Shot Adaptation of Large Vision-Language Models},
author = {Yassir Bendou and Amine Ouasfi and Vincent Gripon and Adnane Boukhayma},
journal= {arXiv preprint arXiv:2501.11175},
year = {2025}
}
备注
Code available at https://ybendou.github.io/ProKeR