中文

面向医学视觉语言模型的校准感知提示学习

计算机视觉与模式识别 2025-09-19 v1

摘要

医学视觉语言模型(Med-VLMs)通过大规模图像-文本预训练在多样化的医学影像任务中展现出显著性能。然而,其置信度校准尚未被充分探索,仍然是一个重大挑战。因此,校准不当的预测可能导致过度自信的误判,削弱临床信任和决策可靠性。为解决这一问题,我们引入CalibPrompt——首个在提示调优过程中校准Med-VLMs的框架。CalibPrompt在标注数据稀缺的条件下,通过精心设计的校准目标优化一组可学习的提示。首先,我们研究一种正则化项,试图将平滑准确率与模型预测置信度对齐。其次,我们引入角度分离损失以最大化文本特征接近性,从而提升多模态Med-VLMs在置信度估计方面的可靠性。在四个公开Med-VLMs和五个多样化医学影像数据集上的广泛实验表明,CalibPrompt在显著不影响干净准确率的前提下持续改善了校准效果。我们的代码可在https://github.com/iabh1shekbasu/CalibPrompt获取。

关键词

引用

@article{arxiv.2509.15226,
  title  = {Calibration-Aware Prompt Learning for Medical Vision-Language Models},
  author = {Abhishek Basu and Fahad Shamshad and Ashshak Sharifdeen and Karthik Nandakumar and Muhammad Haris Khan},
  journal= {arXiv preprint arXiv:2509.15226},
  year   = {2025}
}

备注

Accepted in BMVC 2025