大型视觉语言模型中胸部X光推理的视觉归因重新思考
计算机视觉与模式识别
2026-05-20 v1 人工智能
计算与语言
摘要
大型视觉语言模型(Large Vision Language Models, LVLMs)在医疗领域展现出广泛潜力,但其无法忠实地将响应锚定在视觉证据之上,引发了对临床可信度的严重质疑。虽然视觉归因方法在LVLM预测中广泛用于解释,但这些解释是否实际反映模型决策所依据的视觉证据,目前鲜有探讨,因为通常缺乏针对内部模型推理的真实标注。我们针对胸部X光(Chest X-ray, CXR)推理问题构建了因果评估框架,仅保留经专家标注区域经反事实编辑验证、且被证明对模型预测具有因果影响的CXR-VQA样本。我们通过该框架测试了11种归因方法、6个开源LVLMs,以及两种输出模式(直接回答和逐步推理),发现现有归因方法常常未能识别LVLMs所使用的证据。为此,我们提出MedFocus,一种基于概念的归因方法,通过非平衡最优输运(unbalanced optimal transport)局部解剖学区域,并通过针对性干预衡量其对模型输出的因果效应。MedFocus生成空间、概念层面和标记层面的归因,并显著优于先前方法,为医疗LVLMs的更可信归因迈出了一步。我们的数据和代码已公开于https://github.com/gzxiong/medfocus/。
引用
@article{arxiv.2605.20158,
title = {Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models},
author = {Guangzhi Xiong and Qiao Jin and Sanchit Sinha and Zhiyong Lu and Aidong Zhang},
journal= {arXiv preprint arXiv:2605.20158},
year = {2026}
}