中文

MedXpertQA:评估专家水平医学推理与理解的基准测试

人工智能 2025-06-09 v3 计算与语言 计算机视觉与模式识别 机器学习

摘要

我们介绍 MedXpertQA,这是一个高度具有挑战性和全面的基准测试,用于评估专家水平的医学知识和高级推理能力。MedXpertQA 包含 4,460 个问题,覆盖 17 个医学专科和 11 个身体系统。其包含两个子集:Text 用于文本评估,MM 用于多模态评估。值得注意的是,MM 引入了具有多样图像和丰富临床信息的专家水平考试问题,包括患者病历和检查结果,这与传统医学多模态基准测试(仅包含来自图像标题生成的简单 QA 对)形成鲜明区别。MedXpertQA 针对现有基准测试(如 MedQA)难度不足的问题,采用严格的筛选与增强措施,并纳入专科考试题目以提升临床相关性和全面性。我们进行数据合成以缓解数据泄露风险,并通过多轮专家审核确保准确性和可靠性。我们在 \benchmark 上评估了 18 个领先模型。此外,医学与现实决策密切相关,为评估超越数学和代码的推理能力提供了丰富且具代表性的场景。为此,我们开发了一个以推理为导向的子集,以促进 o1 类模型的评估。代码和数据已公开:https://github.com/TsinghuaC3I/MedXpertQA

关键词

引用

@article{arxiv.2501.18362,
  title  = {MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding},
  author = {Yuxin Zuo and Shang Qu and Yifei Li and Zhangren Chen and Xuekai Zhu and Ermo Hua and Kaiyan Zhang and Ning Ding and Bowen Zhou},
  journal= {arXiv preprint arXiv:2501.18362},
  year   = {2025}
}

备注

ICML 2025