中文

MedBLINK: 探究医学多模态语言模型的基础感知能力

人工智能 2025-08-06 v1

摘要

多模态语言模型 (MLMs) 在临床决策支持和诊断推理方面展现出潜力,带来了端到端自动化医学图像解读的前景。然而,临床医生对 AI 工具的采用极为挑剔;如果一个模型在看似简单的感知任务上犯错,例如判断图像方向或识别 CT 扫描是否为增强扫描,就不太可能被用于临床任务。我们引入了 MedBLINK,这是一个旨在探究这些模型此类感知能力的基准。MedBLINK 跨越多种成像模态和解剖区域,涵盖八项具有临床意义的任务,共计 1,605 张图像上的 1,429 道多项选择题。我们评估了 19 个最先进的 MLMs,包括通用模型 (GPT4o, Claude 3.5 Sonnet) 和特定领域模型 (Med Flamingo, LLaVA Med, RadFM)。人类标注者的准确率达到 96.4%,而表现最好的模型仅达到 65%。这些结果表明,当前的 MLMs 在常规感知检查中经常失败,提示需要加强其视觉基础以支持临床应用。数据可在我们的项目主页获取。

关键词

引用

@article{arxiv.2508.02951,
  title  = {MedBLINK: Probing Basic Perception in Multimodal Language Models for Medicine},
  author = {Mahtab Bigverdi and Wisdom Ikezogwo and Kevin Zhang and Hyewon Jeong and Mingyu Lu and Sungjae Cho and Linda Shapiro and Ranjay Krishna},
  journal= {arXiv preprint arXiv:2508.02951},
  year   = {2025}
}