无惊慌的提示:属性感知的零样本测试时校准
计算机视觉与模式识别
2025-07-01 v1 机器学习
摘要
视觉语言模型 (VLM) 通过在大规模数据集上进行自监督训练,在图像识别方面展现了惊人的性能。通过对测试样本进行适应性调整,可进一步提高其性能,这种方法称为测试时提示调谐 (TPT)。不幸的是,TPT方法仅聚焦于提高准确率,导致对置信度校准的关注不足。这限制了TPT在关键应用场景中的实用性。本文作出三项贡献:(1) 我们认为,提示的随机或不恰当初始化会导致对特定测试样本的过拟合,是VLM在TPT后出现误校准的主要原因。为缓解此问题,我们提出了一种利用大语言模型 (LLM)中关于目标标签属性先验知识进行测试时提示小心初始化的方法;(2) 为进一步维持提示质量,我们提出了一种新型正则化损失,以减少类内距离并增大类间距离。通过在不同CLIP架构和15个数据集上的大量实验,我们展示了该方法能够有效改进TPT后的校准性能。我们的方法TCA在平均期望校准误差 (ECE)上达到4.11,显著优于原始TPT的11.7、C-TPT (ICLR'24)的6.12、DiffTPT (CVPR'23)的6.78以及PromptAlign (NeurIPS'23)的8.43。代码已公开访问:https://github.com/rhebbalaguppe/TCA_PromptWithoutPanic。
引用
@article{arxiv.2506.22819,
title = {Prompting without Panic: Attribute-aware, Zero-shot, Test-Time Calibration},
author = {Ramya Hebbalaguppe and Tamoghno Kandar and Abhinav Nagpal and Chetan Arora},
journal= {arXiv preprint arXiv:2506.22819},
year = {2025}
}
备注
26 pages