预测熵与医学视觉语言模型的校准及释义不敏感性
机器学习
2026-04-13 v1
摘要
医学视觉语言模型 VLMs 存在两种威胁安全部署的失效模式:信心校准不足以及对问题释义的敏感性。我们通过在 MIMIC CXR 和 PadChest 胸部X光数据集上,对 MedGemma 4BIT 进行基准测试,并在 LLaVA RAD7B 上进行跨模型验证,显示这两种问题共享一个共同原因:靠近决策边界。对于经过良好校准的单一模型方法,单次前向传播的预测熵可预测在释义后会翻转的样本,在 MedGemma 上 AUROC 为 0.711,在 LLaVA RAD 上为 0.878,使用单个熵阈值即可标记两类不可靠和释义敏感的预测。五成员 LoRA 集成在 MIMIC-PadChest 偏移下表现不佳,ECE 为 42.9,准确率为 34.1%,尽管 LLaVA RAD 的集成未崩溃,ECE 为 69.1。MC Dropout 在校准效果方面最佳,ECE 为 4.3,在 5% 风险下选择性预测覆盖率为 21.5%,然而单次前向传播的总熵在两方面均优于集成:错误检测 AUROC 为 0.743 vs 0.657,释义筛选效果更佳。简单方法更优。
引用
@article{arxiv.2604.08941,
title = {Predictive Entropy Links Calibration and Paraphrase Sensitivity in Medical Vision-Language Models},
author = {Binesh Sadanandan and Vahid Behzadan},
journal= {arXiv preprint arXiv:2604.08941},
year = {2026}
}