GMAI-MMBench:面向通用医学人工智能的全面多模态评估基准
图像与视频处理
2024-10-22 v7 计算机视觉与模式识别
摘要
大型视觉语言模型(LVLMs)能够处理多种数据类型,如图像、文本和生理信号,并可应用于多个领域。在医学领域,LVLMs 有望为诊断和治疗提供重大辅助。在此之前,开发用于评估 LVLMs 在各种医学应用中有效性的基准至关重要。现有基准通常基于特定学术文献,主要关注单一领域,且缺乏不同的感知粒度。因此,它们面临特定挑战,包括临床相关性有限、评估不完整以及对交互式 LVLMs 的指导不足。为解决这些局限性,我们开发了 GMAI-MMBench,这是迄今为止最全面的通用医学人工智能基准,具有结构良好的分类数据和多感知粒度。它由 284 个数据集构建而成,涵盖 38 种医学影像模态、18 项临床相关任务、18 个科室以及视觉问答(VQA)格式下的 4 种感知粒度。此外,我们实现了词汇树结构,允许用户自定义评估任务,以满足各种评估需求,并极大地支持医学人工智能研究和应用。我们评估了 50 个 LVLMs,结果显示即使先进的 GPT-4o 仅达到 53.96% 的准确率,表明仍有显著提升空间。此外,我们识别出当前最先进 LVLMs 中的五个关键不足,需要加以解决以推动更好医学应用的发展。我们相信 GMAI-MMBench 将激励社区构建下一代 LVLMs,迈向通用医学人工智能(GMAI)。
引用
@article{arxiv.2408.03361,
title = {GMAI-MMBench: A Comprehensive Multimodal Evaluation Benchmark Towards General Medical AI},
author = {Pengcheng Chen and Jin Ye and Guoan Wang and Yanjun Li and Zhongying Deng and Wei Li and Tianbin Li and Haodong Duan and Ziyan Huang and Yanzhou Su and Benyou Wang and Shaoting Zhang and Bin Fu and Jianfei Cai and Bohan Zhuang and Eric J Seibel and Junjun He and Yu Qiao},
journal= {arXiv preprint arXiv:2408.03361},
year = {2024}
}
备注
GitHub: https://github.com/uni-medical/GMAI-MMBench Hugging face: https://huggingface.co/datasets/OpenGVLab/GMAI-MMBench