理解与缓解面向视觉语言模型的提示调优中的失准问题
机器学习
2025-05-30 v4
摘要
置信度校准对于机器学习模型在现实世界中的安全部署至关重要。然而,此类问题在视觉语言模型(如 CLIP),尤其是在微调后,尚未得到充分关注。本文演示现有提示调优方法通常导致基本类和新类的校准之间权衡:CoOp 中的交叉熵损失通过增加文本标签偏离导致新类过度自信,而 KgCoOp 的正则化保持置信度水平但因准确率提高导致基本类低估。基于观察,我们引入动态异常正则化(DOR),确保在微调后基本类和新类的置信度校准。具体而言,我们提议最小化来自大型词汇表的新文本标签(而非基本类)的特征偏差。实际上,DOR 防止新标签文本偏离增加,同时放宽对基本类的限制。大量实验表明,DOR 可增强当前微调方法在基本类和新类上的校准性能。
引用
@article{arxiv.2410.02681,
title = {Understanding and Mitigating Miscalibration in Prompt Tuning for Vision-Language Models},
author = {Shuoyuan Wang and Yixuan Li and Hongxin Wei},
journal= {arXiv preprint arXiv:2410.02681},
year = {2025}
}
备注
Accepted by ICML 2025