一致但危险:逐样本安全分类揭示医学视觉语言模型中的虚假可靠性
计算机视觉与模式识别
2026-03-24 v1
摘要
在释义下的一致性,即语义等价的提示产生相同的预测,正日益被用作部署医学视觉语言模型(VLMs)时的可靠性代理。我们证明这个代理从根本上是有缺陷的:一个模型可以通过依赖文本模式而非输入图像来实现完美的一致性。我们引入了一个四象限逐样本安全分类法,联合评估一致性(在释义提示之间稳定的预测)和图像依赖性(移除图像时预测发生变化)。样本被分类为理想(一致且依赖图像)、脆弱(不一致但依赖图像)、危险(一致但不依赖图像)或最差(不一致且不依赖图像)。在两个胸部 X 光数据集(MIMIC-CXR、PadChest)上评估五种医学 VLM 配置,我们发现 LoRA 微调显著降低了翻转率,但将大多数样本转移到危险象限:LLaVA-Rad Base 在 PadChest 上实现 1.5% 的翻转率,但其 98.5% 的样本是危险的。关键的是,危险样本表现出高准确率(高达 99.6%)和低熵,使其在标准置信度筛选中不可见。我们观察到翻转率与危险比例之间的负相关(r = -0.89, n=10),并建议部署评估始终将一致性检查与文本仅基线配对:一次额外的前向传播,暴露了虚假可靠性陷阱。
引用
@article{arxiv.2603.20985,
title = {Consistent but Dangerous: Per-Sample Safety Classification Reveals False Reliability in Medical Vision-Language Models},
author = {Binesh Sadanandan and Vahid Behzadan},
journal= {arXiv preprint arXiv:2603.20985},
year = {2026}
}
备注
CVPR 2026 Workshop on Medical Reasoning with Vision Language Foundation Models