中文

超越炒作:对医学场景中视觉语言模型的客观审视

计算机视觉与模式识别 2025-06-30 v2 人工智能

摘要

大型视觉语言模型(LVLMs)的最新进展在多种任务上展示了显著能力,在 AI 社区引起了广泛关注。然而,它们在医学等专门领域的性能和可靠性仍评估不足。特别是,大多数评估过度集中于基于多模态数据的简单视觉问答(VQA)来评估 VLM,而忽略了 LVLMs 的深层特征。在本研究中,我们引入了 RadVUQA——一种新型放射学视觉理解与问答基准,用于全面评估现有 LVLMs。RadVUQA 主要从五个维度验证 LVLMs:1)解剖学理解,评估模型视觉上识别生物结构的能力;2)多模态理解,涉及解释语言和视觉指令以产生期望结果的能力;3)定量与空间推理,评估模型的空间意识以及结合定量分析与视觉和语言信息的能力;4)生理学知识,衡量模型理解器官和系统功能与机制的能力;5)鲁棒性,评估模型在非标准化和合成数据上的能力。结果表明,通用 LVLMs 和医学专用 LVLMs 均存在严重缺陷,多模态理解和定量推理能力薄弱。我们的发现揭示了现有 LVLMs 与临床医生之间的巨大差距,凸显了对更鲁棒、更智能的 LVLMs 的迫切需求。代码可在 https://github.com/Nandayang/RadVUQA 获取。

关键词

引用

@article{arxiv.2408.08704,
  title  = {Beyond the Hype: A dispassionate look at vision-language models in medical scenario},
  author = {Yang Nan and Huichi Zhou and Xiaodan Xing and Guang Yang},
  journal= {arXiv preprint arXiv:2408.08704},
  year   = {2025}
}

备注

10 pages