审计前沿视觉-语言模型以实现可信的医学视觉问答:定位失败、格式崩溃与领域适应
人工智能
2026-05-01 v1
摘要
在临床环境中部署视觉-语言模型(VLMs)要求在现实的失败条件下具有可审计的行为,然而前沿VLMs在专业医学输入上的失败图景尚未得到充分刻画。我们沿着两个与信任相关的轴,在医学VQA上审计了五个近期前沿且具有定位感知能力的VLMs(Gemini 2.5 Pro、GPT-5、o3、GLM-4.5V、Qwen 2.5 VL)。感知方面:所有模型对解剖和病理目标的定位都很差——最佳模型仅达到0.23的平均IoU和19.1%的[email protected]——并表现出临床危险的左右混淆。流程集成方面:一个自定位流程,即同一模型先定位后回答,降低了每个模型的VQA准确率——这是由于在两步提示下,定位不准确和格式合规失败共同导致的(在VQA-RAD上,Gemini和GPT-5的解析失败率上升至70%–99%)。用真实标注框替换预测框可以恢复并提高VQA准确率,这与失败源于感知模块而非分解过程本身的情况一致。这些观察发现将定位质量确定为我们SLAKE边界框设置中的主要可信度瓶颈。作为补充的微调后续工作,在组合的Med-VQA训练数据上对Qwen 2.5 VL进行监督微调,在可比方法中达到了最高的SLAKE开放式召回率(85.5%),这表明VQA层面的差距可以通过领域适应来解决;这是否也能解决感知/可信度瓶颈则留待未来工作。
引用
@article{arxiv.2604.27720,
title = {Auditing Frontier Vision-Language Models for Trustworthy Medical VQA: Grounding Failures, Format Collapse, and Domain Adaptation},
author = {Xupeng Chen and Binbin Shi and Chenqian Le and Qifu Yin and Lang Lin and Haowei Ni and Ran Gong and Panfeng Li},
journal= {arXiv preprint arXiv:2604.27720},
year = {2026}
}