大型语言模型在临床数值理解方面是否稳健?基于临床情境中数值推理能力的实证研究
计算与语言
2026-04-16 v2
摘要
大型语言模型(LLMs)正越来越多地被用于临床问答和决策支持,但安全部署严重依赖于其在异构临床笔记中可靠处理患者测量值的能力。现有评估LLMs进行临床数值推理的工作在操作层面覆盖有限,主要局限于算术计算,且很少评估数值理解在临床笔记格式变化下的鲁棒性。我们引入ClinicNumRobBench,这是一个包含1,624个上下文-问题实例并标注真实答案的基准测试,旨在评估四类主要临床数值能力:值检索、算术计算、关系比较和聚合。为检验鲁棒性,ClinicNumRobBench以三种在语义上等价的表述呈现纵向MIMIC-IV生命体征记录,其中包括来自Open Patients数据集派生的真实世界笔记风格变体,并采用42个问题模板实例化查询。对17个LLMs进行实验显示,值检索通常表现良好,大多数模型准确率超过85%,而关系比较和聚合仍具有挑战性,部分模型得分不足15%。在医疗数据上进行微调会使数值能力相对于基础模型下降超过30%,且在笔记风格变化下的性能下降表明LLMs对格式较为敏感。ClinicNumRobBench为临床可靠的数值推理提供了严谨的测试基准。代码和数据URL已提供于https://github.com/MinhVuong2000/ClinicNumRobBench。
引用
@article{arxiv.2604.11133,
title = {How Robust Are Large Language Models for Clinical Numeracy? An Empirical Study on Numerical Reasoning Abilities in Clinical Contexts},
author = {Minh-Vuong Nguyen and Fatemeh Shiri and Zhuang Li and Karin Verspoor},
journal= {arXiv preprint arXiv:2604.11133},
year = {2026}
}
备注
Accepted to ACL2026 Findings