MedAtlas:评估跨多模态医学影像与临床文本中LLMs的多轮、多任务医学推理能力
计算机视觉与模式识别
2025-08-18 v1
摘要
人工智能在临床决策中展现出巨大的潜力;然而,开发能够适应多样真实场景并执行复杂诊断推理的模型仍然是最大的挑战。现有医学多模态基准通常仅限于单张图像、单轮任务,缺乏医学图像的多模态集成,无法捕捉临床实践中固有的纵向和多模态交互性。为此,我们引入MedAtlas,一个新颖的基准框架,用于评估大型语言模型在真实世界医学推理任务中的表现。MedAtlas具有四个关键特征:多轮对话、多模态医学图像交互、多任务集成和高度临床忠实性。它支持四个核心任务:开放式多轮问答、封闭式多轮问答、多图像联合推理和综合性疾病诊断。每个案例均源自真实的诊断工作流程,融合了文本医学史与多种影像模态(包括CT、MRI、PET、超声和X光)之间的时序交互,要求模型在图像和临床文本之间进行深层集成推理。MedAtlas为所有任务提供专家标注的金标准。此外,我们提出了两种新颖的评估指标:Round Chain Accuracy 和 Error Propagation Resistance。基准结果显示,现有多模态模型在多阶段临床推理中存在显著的性能差距。MedAtlas为推动健壮可信的医学AI发展建立了具有挑战性的评估平台。
引用
@article{arxiv.2508.10947,
title = {MedAtlas: Evaluating LLMs for Multi-Round, Multi-Task Medical Reasoning Across Diverse Imaging Modalities and Clinical Text},
author = {Ronghao Xu and Zhen Huang and Yangbo Wei and Xiaoqian Zhou and Zikang Xu and Ting Liu and Zihang Jiang and S. Kevin Zhou},
journal= {arXiv preprint arXiv:2508.10947},
year = {2025}
}