面向医学视觉语言模型的校准感知提示学习
计算机视觉与模式识别
2025-09-19 v1
摘要
医学视觉语言模型(Med-VLMs)通过大规模图像-文本预训练在多样化的医学影像任务中展现出显著性能。然而,其置信度校准尚未被充分探索,仍然是一个重大挑战。因此,校准不当的预测可能导致过度自信的误判,削弱临床信任和决策可靠性。为解决这一问题,我们引入CalibPrompt——首个在提示调优过程中校准Med-VLMs的框架。CalibPrompt在标注数据稀缺的条件下,通过精心设计的校准目标优化一组可学习的提示。首先,我们研究一种正则化项,试图将平滑准确率与模型预测置信度对齐。其次,我们引入角度分离损失以最大化文本特征接近性,从而提升多模态Med-VLMs在置信度估计方面的可靠性。在四个公开Med-VLMs和五个多样化医学影像数据集上的广泛实验表明,CalibPrompt在显著不影响干净准确率的前提下持续改善了校准效果。我们的代码可在https://github.com/iabh1shekbasu/CalibPrompt获取。
引用
@article{arxiv.2509.15226,
title = {Calibration-Aware Prompt Learning for Medical Vision-Language Models},
author = {Abhishek Basu and Fahad Shamshad and Ashshak Sharifdeen and Karthik Nandakumar and Muhammad Haris Khan},
journal= {arXiv preprint arXiv:2509.15226},
year = {2025}
}
备注
Accepted in BMVC 2025