针对微调 CLIP 的开放词汇校准
机器学习
2024-06-17 v4
摘要
视觉-语言模型 (Vision-language models, VLMs) 已成为强大的工具,在图像识别、文本驱动的视觉内容生成和视觉聊天机器人等诸多开放词汇任务中展现出卓越能力。近年来,人们投入了大量精力与资源用于改进 VLMs 下游性能的适应方法,特别是像提示学习这样的参数高效微调方法。然而,一个被 largely 忽视的关键方面是微调 VLMs 中的置信度校准问题,这可能会在现实世界中部署此类模型时大大降低可靠性。本文通过系统研究提示学习背景下的置信度校准问题填补了这一空白,并揭示了现有的校准方法不足以解决该问题,尤其是在开放词汇设置下。为解决该问题,我们提出了一种简单有效的方法,称为距离感知校准 (Distance-Aware Calibration, DAC),该方法基于预测文本标签与基类之间的距离作为指导来缩放温度。在 11 个不同的下游数据集上应用 7 种不同提示学习方法的实验证明了 DAC 的有效性,它在保持高效率的同时不牺牲推理速度。我们的代码可在 https://github.com/ml-stat-Sustech/CLIP_Calibration 获取。
引用
@article{arxiv.2402.04655,
title = {Open-Vocabulary Calibration for Fine-tuned CLIP},
author = {Shuoyuan Wang and Jindong Wang and Guoqing Wang and Bob Zhang and Kaiyang Zhou and Hongxin Wei},
journal= {arXiv preprint arXiv:2402.04655},
year = {2024}
}
备注
Accepted by ICML 2024