面向微调 CLIP 的对比感知校准:利用图像-文本对齐
计算机视觉与模式识别
2025-02-06 v3 机器学习
摘要
视觉-语言模型(VLM),如 CLIP,已显示出卓越的泛化能力,可通过 prompt 微调快速适应下游任务。不幸的是,在涉及非训练类的分类任务中,即所谓的 open-vocabulary 设置下,微调后的 VLM 常对训练类的类别过拟合,导致置信度分数与实际准确率在未见类别之间不再对齐,这显著削弱了其在实际部署中的可靠性。现有的置信度校准方法通常需要训练参数或分析来自训练数据集的特征,限制了其在没有相应训练数据的情况下对未见类别的泛化能力。此外,VLM-specific 校准方法仅依赖训练类的文本特征作为校准指示器,这本质上限制了其校准训练类的能力。为此,我们提出一种有效的多模态校准方法对比感知校准(Contrast-Aware Calibration, CAC)。基于原始 CLIP 的 zero-shot 适应性以及来自经验分析的结论——即在未见类别上的较差类内和类间判别能力是根本原因——我们计算基于原始和微调 CLIP 之间对比差异的校准权重。该方法不仅适用于校准未见类别,还克服了以前 VLM 校准方法无法校准训练类的局限性。在涉及 11 个数据集和 5 种微调方法的实验中,CAC 在训练和未见类别上均实现了最佳的校准效果,且未牺牲准确率和推理速度。
引用
@article{arxiv.2501.19060,
title = {Contrast-Aware Calibration for Fine-Tuned CLIP: Leveraging Image-Text Alignment},
author = {Song-Lin Lv and Yu-Yang Chen and Zhi Zhou and Yu-Feng Li and Lan-Zhe Guo},
journal= {arXiv preprint arXiv:2501.19060},
year = {2025}
}