评估医学多模态视觉语言模型推理忠诚度:基于多模态扰动的方法
计算与语言
2025-11-11 v2 计算机视觉与模式识别
摘要
视觉语言模型(VLM)常产生听起来合理却未能反映底层决策过程的链式思维(CoT)解释,削弱了在临床高风险场景中的可信度。现有评估方法很少能捕捉到这种误差,侧重于答案准确性或格式遵循性。我们提出了一种临床导向的框架,用于胸部X线视觉问答(VQA)任务,通过受控的文本和图像修改探测CoT忠诚度,涉及三个维度:临床忠实度、因果归因和置信度校准。在读者研究中(n=4),评估者与放射科医生之间的相关性在所有维度上均落于观察到的放射科医生间变异范围内,归因维度呈强对齐(Kendall's ),忠实度呈中等对齐(),而置信度语气对齐较弱(),我们持谨慎态度报告。对六个VLM进行基准测试显示,答案准确性与解释质量可被解耦,确认注入线索并不确保 grounding,文本线索对解释的影响大于视觉线索。虽然一些开源模型在最终答案准确性方面可与之匹敌,但专有模型在归因(25.0% vs. 1.4%)和忠实度(36.1% vs. 31.7%)上通常得分更高,凸显了部署风险以及超越最终答案准确性评估的必要性。
引用
@article{arxiv.2510.11196,
title = {Evaluating Reasoning Faithfulness in Medical Vision-Language Models using Multimodal Perturbations},
author = {Johannes Moll and Markus Graf and Tristan Lemke and Nicolas Lenhart and Daniel Truhn and Jean-Benoit Delbrouck and Jiazhen Pan and Daniel Rueckert and Lisa C. Adams and Keno K. Bressem},
journal= {arXiv preprint arXiv:2510.11196},
year = {2025}
}
备注
Accepted to ML4H 2025 Proceedings