PSF-Med: 测量和解释医学视觉语言模型中的语义置换敏感性
计算机视觉与模式识别
2026-04-14 v2 机器学习
摘要
医学视觉语言模型 (VLMs) 在临床医生重新表述相同问题时会改变其答案,这种失效模式威胁了部署安全性。我们引入 PSF-Med,这是一个包含 26,850 个胸部 X 光问题及其 92,856 个语义等价改写的基准测试,覆盖 MIMIC-CXR、PadChest 和 VinDr-CXR,涵盖美国、西班牙和越南的临床人群。每个改写均通过基于双向临床蕴涵规则的 LLM 评判器验证,跨家族一致性达91.6%。在九个 VLMs(包括通用模型)中,我们发现翻转率介于3%至37%之间。然而,低翻转率并不意味着视觉 grounding:文本-only 基线显示,某些模型即使在图像被移除时仍保持一致,表明它们依赖语言偏置。为研究一种模型的机制,我们对 MedGemma 4B 应用 GemmaScope 2 稀疏自动编码器 (SAE),分析 FlipBank,即 158 个翻转案例的精选集。我们识别出一个位于第 17 层的稀疏特征,其与提示框架相关并预测决策边际变化。在因果修补实验中,移除该特征的贡献可在平均情况下恢复 45% 的 yes-minus-no logit 边际,并完全逆转 15% 的翻转。在此基础上,我们证明将该识别特征在推理时限制为零,可将翻转率降低 31%,仅以 1.3 个百分点的准确率代价,同时降低文本偏置依赖。这些结果表明,翻转率本身不足以评估鲁棒性;鲁棒性评估应同时测试语义稳定性和图像依赖性。
关键词
引用
@article{arxiv.2602.21428,
title = {PSF-Med: Measuring and Explaining Paraphrase Sensitivity in Medical Vision Language Models},
author = {Binesh Sadanandan and Vahid Behzadan},
journal= {arXiv preprint arXiv:2602.21428},
year = {2026}
}