中文

诊断推理基准:诊断竞技场

计算与语言 2025-05-30 v4 人工智能

摘要

大型语言模型在执行复杂推理任务方面展现出突破性能力,为解决各种科学挑战,包括复杂临床情景中的问题,具有巨大潜力。为确保其在真实世界医疗环境中的安全有效部署,迫切需要系统性地评估当前模型的诊断能力。鉴于现有医学基准在评估高级诊断推理方面的局限性,我们提出 DiagnosisArena,一个全面且具挑战性的基准,旨인 rigorously 评估专业水平的诊断能力。DiagnosisArena 由 1,113 对分段患者病例及其对应诊断组成,覆盖 28 个医学专科,源自十大顶级医学期刊上的临床病例报告。该基准通过严密的构建管道开发,包括来自 AI 系统和人类专家的多轮筛选和审查,进行彻底检查以防止数据泄露。我们的研究表明,即便是最先进的推理模型 o3、o1 和 DeepSeek-R1 在临床诊断推理挑战中分别仅达到 51.12%、31.09% 和 17.79% 的准确率。这一发现凸显了当前大型语言模型在面对临床诊断推理挑战时存在的显著概括性瓶颈。通过 DiagnosisArena,我们旨在推动 AI 诊断推理能力的进一步发展,为解决真实世界临床诊断挑战提供更有效的解决方案。我们提供该基准和评估工具供进一步研究与开发 https://github.com/SPIRAL-MED/DiagnosisArena

关键词

引用

@article{arxiv.2505.14107,
  title  = {DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models},
  author = {Yakun Zhu and Zhongzhen Huang and Linjie Mu and Yutong Huang and Wei Nie and Jiaji Liu and Shaoting Zhang and Pengfei Liu and Xiaofan Zhang},
  journal= {arXiv preprint arXiv:2505.14107},
  year   = {2025}
}