面向视觉语言模型少样本分类的置信度校准协变量偏移校正
计算机视觉与模式识别
2025-04-09 v2 机器学习
摘要
自从视觉语言基础模型成为少样本视觉分类任务的新主流以来,由目标数据不足引发的领域泛化问题日益重要。这种数据稀缺挑战引发了采样偏差,并放大了模型对数据分布变化与偏移的敏感性。虽然在多个领域上进行微调可以缓解此类领域泛化问题,但这不仅消耗大量资源,还需要多样化的数据源。在本工作中,我们系统分析了两个关键挑战:(1)预训练分布与欠定目标分布之间的协变量偏移;(2)置信度失准,即对新颖数据的预测过于自信。为同时应对这两个挑战,我们引入了 \textbf{置信度校准的协变量偏移校正}——这是一种统一的方法,结合了用于缓解协变量偏移的 Fisher 信息惩罚和用于降低误分类样本过度自信的置信度失准惩罚(CMP)。在多个视觉和协变量偏移基准上的实验评估表明,CalShift 显著改善了模型校准,使期望校准误差(ECE)最多降低 5.82\%。此外,CalShift 增强了鲁棒性,在受协变量偏移影响的挑战性数据集上将准确率提高了 3.5\%。我们的结果突显了 CalShift 作为一种有前景的策略,可为实际应用构建鲁棒且可靠的少样本视觉语言系统。
引用
@article{arxiv.2502.07847,
title = {Confidence-calibrated covariate shift correction for few-shot classification in Vision-Language Models},
author = {Behraj Khan and Rizwan Qureshi and Nouman Muhammad Durrani and Tahir Syed},
journal= {arXiv preprint arXiv:2502.07847},
year = {2025}
}