LP++:一种用于少样本 CLIP 的出奇强效线性探针
计算机视觉与模式识别
2024-04-04 v1
摘要
在近期大量涌现的关于少样本 CLIP 适应的文献中,Linear Probe (LP) 常被报告为弱基线。这促使了构建复杂的提示学习或特征适应策略的密集研究。在本工作中,我们从凸优化视角提出并考察了标准 LP 基线的一种推广,其中线性分类器权重是文本嵌入的可学习函数,并带有逐类乘数以融合图像与文本知识。由于我们的目标函数依赖于两类变量,即类别视觉原型和可学习融合参数,我们提出了一种计算高效的块坐标 Majorize-Minimize (MM) 下降算法。在我们命名为 LP++ 的全批量 MM 优化器中,步长是隐式的,不同于在验证集上密集搜索学习率的标准梯度下降实践。通过考察我们损失函数的数学性质(例如 Lipschitz 梯度连续性),我们构建了产生数据驱动学习率的优化函数,并推导了损失函数最小值的近似,从而为变量提供数据驱动的初始化。我们的图像-语言目标函数,连同这些非平凡的优化见解和要素,出人意料地产生了极具竞争力的少样本 CLIP 性能。此外,LP++ 以黑盒方式运行,放宽了对优化超参数的密集验证搜索,并且运行速度比 state-of-the-art 少样本 CLIP 适应方法快几个数量级。我们的代码可在:\url{https://github.com/FereshteShakeri/FewShot-CLIP-Strong-Baseline.git} 获取。
引用
@article{arxiv.2404.02285,
title = {LP++: A Surprisingly Strong Linear Probe for Few-Shot CLIP},
author = {Yunshi Huang and Fereshteh Shakeri and Jose Dolz and Malik Boudiaf and Houda Bahig and Ismail Ben Ayed},
journal= {arXiv preprint arXiv:2404.02285},
year = {2024}
}