临床视觉语言模型中的医学上下文如何扭曲决策
计算机视觉与模式识别
2026-05-19 v1 计算与语言
摘要
视觉语言模型(VLM)日益提议用于临床决策支持,但其在需要整合视觉和文本上下文的真实场景中可靠性仍未得到充分 characterize。本文识别了三种失效模式:(1)对文本而非图像的模态过度依赖,(2)对无关临床历史的虚假依赖,(3)在语义等效输入下的提示敏感性。我们评估了多样化的通用领域和医学调优的开放式和封闭式 VLM 在胸部 X 光片任务上的表现,使用 MIMIC-CXR 数据集。通过系统性操控图像-文本对齐、临床历史和提示表述形式,我们发现 VLM 决策主要由文本模态主导,即使视觉证据可用也事实如此。此外,我们观察到 VLM 对无关报告具有重度影响,而微小的提示变更即可逆转基于图像的正确预测。我们的发现强调了在考虑将这些模型用于临床实践之前,需对其进行显式的安全措施和压力测试。
引用
@article{arxiv.2605.17436,
title = {Medical Context Distorts Decisions in Clinical Vision Language Models},
author = {David Restrepo and Ira Ktena and Maria Vakalopoulou and Stergios Christodoulidis and Enzo Ferrante},
journal= {arXiv preprint arXiv:2605.17436},
year = {2026}
}