ER-Reason: 面向急诊室 LLM 临床推理的基准数据集
计算与语言
2026-05-12 v3
摘要
用于评估大型语言模型 (LLM) 临床推理能力的现有基准通常缺乏对“临床推理”这一构念的明确定义,未能涵盖临床工作流中相互依赖任务的完整范畴,且依赖于程式化的书面情境而非真实世界的临床记录。因此,近期研究发现,LLM 在源自医学执照考试的程式化基准上的表现与其在真实世界前瞻性研究中的表现存在显著差异。为解决这些局限性,我们引入了 ER-Reason,这是一个旨在评估 LLM 推理能力的基准,其评估方式是随着临床证据在贯穿急诊医学完整工作流的决策任务中不断积累来进行考量。ER-Reason 包含来自 3,437 名患者的 25,174 份去标识化临床记录,支持在急诊科工作流的所有阶段进行评估:分诊入院、治疗选择、处置规划以及最终诊断。至关重要的是,ER-Reason 的评估超越了诊断准确性,包含了基于真实患者病例的逐步脚本一致性测试 (SCT) 式问题,用于评估 LLM 是否随着临床证据的积累而以正确的方向和幅度更新其诊断信念,并以 2,555 条急诊医师标注作为评分依据。我们在 ER-Reason 上评估了推理与非推理 LLM,并表明与现有基准相比,我们的任务提供了对 LLM 推理在真实患者病例上如何失败的更细致视角。
引用
@article{arxiv.2505.22919,
title = {ER-Reason: A Benchmark Dataset for LLM Clinical Reasoning in the Emergency Room},
author = {Nikita Mehandru and Niloufar Golchini and Namrata Garg and Kathy T. LeSaint and Christopher J. Nash and Anu Ramachandran and Travis Zack and Liam G. McCoy and Adam Rodman and David Bamman and Melanie Molina and Ahmed Alaa},
journal= {arXiv preprint arXiv:2505.22919},
year = {2026}
}