AcuityBench:评估临床紧急度识别与不确定性对齐
人工智能
2026-05-13 v1 计算与语言
摘要
我们引入 AcuityBench,一个用于评估语言模型能否根据用户医疗陈述识别适当护理紧急度的基准。现有的健康基准侧重于医学问答、广泛的健康交互或狭窄的工作流特定分诊任务,但并未提供跨这些场景的紧急度识别的统一评估。AcuityBench 通过将涵盖用户对话、在线论坛帖子、临床案例和患者门户消息的五个公开数据集,统一到一个从居家监测到立即急诊的四级紧急度框架下,弥补了这一空白。该基准包含 914 个案例,其中 697 个共识案例用于标准准确性评估,217 个经医生确认的模糊案例用于不确定性感知评估。它支持两种互补的任务形式:问答场景中的显式四分类,以及使用基于同一框架的评分标准评估的自由形式对话回复。在 12 个前沿闭源和开源模型上,我们发现它们在明确案例的紧急度准确率和错误方向上存在显著差异。比较任务形式揭示了一个系统性权衡:与问答形式相比,对话回复减少了过度分诊,但增加了分诊不足,尤其是在高紧急度案例中。在模糊案例中,没有模型能紧密匹配医生判断的分布,且模型预测比专家临床不确定性更为集中。我们还在一部分最大模糊度的案例上比较了专家和模型的裁决,利用这些案例来审视临床不确定性在标签分歧中的作用。总之,这些结果将紧急度识别定位为一项独特的安全关键能力,并表明 AcuityBench 能够对模型在真实世界健康应用中引导用户获得适当级别护理的能力进行系统性比较和压力测试。
引用
@article{arxiv.2605.11398,
title = {AcuityBench: Evaluating Clinical Acuity Identification and Uncertainty Alignment},
author = {Robin Linzmayer and Georgianna Lin and Di Coneybeare and Jason Chu and Trudi Cloyd and Manish Garg and Miles Gordon and Elizabeth Hartofilis and Benjamin Hong and Ashraf Hussain and Eugene Y. Kim and Oluchi Iheagwara King and Ross McCormack and Erica Olsen and John K. Riggins and Mustafa N. Rasheed and Dana L. Sacco and Vinay Saggar and Osman R. Sayan and Amit Shembekar and Janice Shin-Kim and Wendy W. Sun and Bernard P. Chang and David Kessler and Noémie Elhadad},
journal= {arXiv preprint arXiv:2605.11398},
year = {2026}
}
备注
41 pages, 5 figures. Preprint under review for the Track on Evaluations and Datasets at NeurIPS 2026