中文

医学多模态大语言模型的谱系评估基准

计算与语言 2024-12-02 v2 计算机视觉与模式识别

摘要

医学多模态大语言模型(Med-MLLMs)取得的显著性突破通过稳健的信息综合和医疗决策支持,重塑了现代医疗保健。然而,这些模型往往在不符合Med-MLLMs实际诊断复杂性的基准上进行评估,这种复杂性跨越多学科。为此,我们引入Asclepius—a 新颖的Med-MLLM基准,全面评估Med-MLLMs在不同医学专科(心血管、消化内科等)和不同诊断能力(感知、疾病分析等)方面的表现。基于提出的3项核心原则,Asclepius通过纳入15个医学专科、划分为3大类和8小类的临床任务类别,以及排除与现有VQA数据集的重叠,确保了全面评估。我们进一步对6个Med-MLLMs进行深入分析,并与3位人类专家进行比较,提供了关于这些模型在各种医疗情境中能力和局限性的见解。我们的工作不仅推进了对Med-MLLMs能力的理解,也为未来评估以及这些模型在临床环境中安全部署树立了先例。

关键词

引用

@article{arxiv.2402.11217,
  title  = {A Spectrum Evaluation Benchmark for Medical Multi-Modal Large Language Models},
  author = {Jie Liu and Wenxuan Wang and Yihang Su and Jingyuan Huan and Wenting Chen and Yudi Zhang and Cheng-Yi Li and Kao-Jung Chang and Xiaohan Xin and Linlin Shen and Michael R. Lyu},
  journal= {arXiv preprint arXiv:2402.11217},
  year   = {2024}
}

备注

20 pages, 15 figures