中文

MedBookVQA:源自开放获取书籍的系统且全面的医学基准

人工智能 2025-06-03 v1

摘要

由多模态大语言模型(MLLMs)驱动的通用医学人工智能(GMAI)的加速发展,为应对包括人力短缺和成本攀升在内的持续医疗挑战提供了变革性潜力。与此同时,系统性评估基准的并行开发成为实现性能评估并提供技术指导的关键诉求。此外,作为宝贵的知识来源,医学教科书在基准开发方面的潜力仍未得到充分利用。在此,我们提出MedBookVQA,一个源自开放获取医学教科书的系统且全面的多模态基准。为构建该基准,我们提出了一条标准化流水线,用于自动提取医学图像并将其与相应的医学叙述进行上下文对齐。基于这些精选数据,我们生成了5,000个具有临床相关性的问题,涵盖模态识别、疾病分类、解剖识别、症状诊断和外科手术。一个多层级标注系统通过包含医学成像模态(42个类别)、人体解剖结构(125个结构)和临床专科(31个科室)的分层分类法对查询进行分类,从而实现跨医学子领域的细致分析。我们评估了广泛的MLLMs,包括专有模型、开源模型、医学模型和推理模型,揭示了不同任务类型和模型类别之间显著的性能差异。我们的发现突出了当前GMAI系统中关键的能力差距,同时确立了源自教科书的多模态基准作为重要的评估工具。MedBookVQA将源自教科书的基准确立为推进临床AI的关键范式,揭示了GMAI系统的局限性,同时提供了跨专科的解剖结构化性能指标。

关键词

引用

@article{arxiv.2506.00855,
  title  = {MedBookVQA: A Systematic and Comprehensive Medical Benchmark Derived from Open-Access Book},
  author = {Sau Lai Yip and Sunan He and Yuxiang Nie and Shu Pui Chan and Yilin Ye and Sum Ying Lam and Hao Chen},
  journal= {arXiv preprint arXiv:2506.00855},
  year   = {2025}
}

备注

For data and code, see: https://huggingface.co/datasets/slyipae1/MedBookVQA and https://github.com/slyipae1/MedBookVQA