中文

医学 MLLM 为何会失败?对医学图像中的视觉定位的研究

计算机视觉与模式识别 2026-03-17 v1 人工智能

摘要

通用多模态大语言模型(MLLM)在广泛的视觉语言任务中取得了令人瞩目的成绩,但在医学任务中,尤其是在关键性泛化的零样态设置下,表现仍不理想。一个关键研究空白是对医学 MLLM 在医学图像解释中为何表现不佳缺乏充分理解。本文提出首个针对医学 MLLM 视觉定位能力的系统性调查。为消除视觉定位与语义定位的干扰,我们设计了 VGMED,这是一个新开发的评估数据集,由专家临床指导,专门评估医学 MLLM 的视觉定位能力。我们引入新的定量指标并进行详细的定性分析。我们在八个最先进(SOTA)医学 MLLM 上进行的研究表明,它们往往未能在临床相关的图像区域中对预测进行定位。我们指出,这一发现特定于医学图像分析;相较之下, prior work 已表明 MLLM 在应用于自然场景图像时能够在正确的图像区域中对预测进行定位。针对这些发现,我们提出了 VGRefine—a 一种简单而有效的推理时方法,通过细化注意力分布来提高医学环境中的视觉定位。我们的方法在 6 个多样化的 Med-VQA 基准上实现了 SOTA 性能(超过 11 万个 VQA 样本,涵盖 8 种影像模式),且无需额外训练或外部专家模型。总体而言,我们首次系统性地验证了视觉定位不足是医学 MLLM 表现不佳的关键贡献因素之一。附录中包含额外实验。

关键词

引用

@article{arxiv.2603.14323,
  title  = {How Do Medical MLLMs Fail? A Study on Visual Grounding in Medical Images},
  author = {Guimeng Liu and Tianze Yu and Somayeh Ebrahimkhani and Lin Zhi Zheng Shawn and Kok Pin Ng and Ngai-Man Cheung},
  journal= {arXiv preprint arXiv:2603.14323},
  year   = {2026}
}

备注

Published as a conference paper at ICLR 2026