MedicalBench:评估大语言模型以改进医学概念提取
计算与语言
2026-05-21 v1
摘要
从电子健康记录中提取医学概念是许多下游应用的基础,但面临挑战,因为医学有意义的概念常常在医学叙述中是隐含的而非明确表述。现有基准数据集以人工标注证据为基础,凸显了在医学文本中 grounding 提取概念的重要性。然而,它们主要聚焦于明确表述的概念,而非隐含概念。我们提出MedicalBench,这是一个基于证据 grounding 的医学概念提取基准,用于评估隐式医学推理。MedicalBench将医学概念提取形式化为对医学笔记-概念对的验证任务,结合句子级证据识别。数据集基于MIMIC-IV出院总结和人工验证的ICD-10编码构建,通过多阶段大语言模型(LLM) triage 流程后进行医学标注和专家审核。它刻意包括隐式阳性、语义可混淆的阴性以及LLM判断与医学专家判断不一致的情况。我们定义两个互补的评估任务:(1)医学概念提取和(2)句子级证据检索,使我们能够评估正确性和可解释性。对现有SOTA LLM进行基准测试显示,性能仍有限,凸显了提取隐式表述概念的难度。我们进一步表明,性能对笔记长度几乎不变,表明MedicalBench隔离了推理难度而非浅显混淆因素。MedicalBench提供了第一个系统性的隐式、证据grounding医学概念提取基准,为开发能够识别医学相关概念并以透明且医学忠实方式解释其预测的医学语言模型奠定了基础。
引用
@article{arxiv.2605.20197,
title = {MedicalBench: Evaluating Large Language Models Toward Improved Medical Concept Extraction},
author = {Zhichao Yang and Gregory D. Lyng and Sanjit Singh Batra and Robert E. Tillman},
journal= {arXiv preprint arXiv:2605.20197},
year = {2026}
}