面向少样本视觉语言模型适应的校准缓存模型
计算机视觉与模式识别
2024-10-14 v1
摘要
基于缓存的模型方法在适应视觉语言模型(VLM)方面表现突出,既有效又高效。然而,现有缓存模型忽略了三个关键方面:1)预训练的 VLM 主要针对图像-文本相似性进行优化,忽略了图像-图像相似性的重要性,导致预训练与适应之间的差距。2)当前的缓存模型基于 Nadaraya-Watson(N-W)估计器构建,未能建模训练样本之间的复杂关系。3)在样本有限的情况下,缓存模型生成的 logits 具有高不确定性,直接使用这些 logits 而不考虑置信度可能存在问题。本文提出三个校准模块以解决上述挑战。相似度校准通过使用无标签图像细化图像-图像相似性。我们在预训练图像编码器顶部添加带残差连接的可学习投影层,并通过最小化自监督对比损失优化参数。权重校准引入精度矩阵到权函数中,以充分建模训练样本之间的关系,将现有缓存模型转化为高斯过程(GP)回归器,相较于 N-W 估计器更为准确。置信度校准利用 GP 回归计算的预测方差动态地重新缩放缓存模型的 logits,确保缓存模型的输出根据其置信度水平得到合适的调整。此外,为降低 GP 的高复杂度,我们进一步提出基于分组的学习策略。综合上述设计,我们提出了训练自由和训练必需两种变体。在 11 个少样本分类数据集上进行大量实验验证,所提方法可实现最佳性能。
引用
@article{arxiv.2410.08895,
title = {Calibrated Cache Model for Few-Shot Vision-Language Model Adaptation},
author = {Kun Ding and Qiang Yu and Haojian Zhang and Gaofeng Meng and Shiming Xiang},
journal= {arXiv preprint arXiv:2410.08895},
year = {2024}
}
备注
submitted to IJCV