EHRStruct:评估结构化电子健康记录任务中大型语言模型的全面基准框架
人工智能
2026-04-02 v4
摘要
结构化电子健康记录(EHR)数据以关系表格存储患者信息,在临床决策中发挥核心作用。近期进展探索利用大型语言模型(LLM)处理此类数据,显示出在各种临床任务上的潜力。然而,缺乏标准化的评估框架和明确定义的任务,使得系统性评估和比较LLM在结构化EHR数据上的性能变得困难。为解决这些评估挑战,我们引入EHRStruct,一个专为评估结构化EHR任务中LLM性能而设计的基准。EHRStruct定义了11个代表性任务,涵盖多样临床需求,并包含2200个任务特定评估样本,源自两个广泛使用的EHR数据集。我们使用EHRStruct评估了20个先进且代表性的LLM,涵盖通用模型和医学模型。我们进一步分析影响模型性能的关键因素,包括输入格式、few-shot泛化和微调策略,并与11种针对结构化数据推理的SOTA LLM增强方法进行比较。我们的结果表明,许多结构化EHR任务对LLM的理解和推理能力提出了高要求。针对这一点,我们提出了EHRMaster方法,通过代码增强实现了最先进的性能,并为指导未来研究提供了实用见解。
引用
@article{arxiv.2511.08206,
title = {EHRStruct: A Comprehensive Benchmark Framework for Evaluating Large Language Models on Structured Electronic Health Record Tasks},
author = {Xiao Yang and Xuejiao Zhao and Zhiqi Shen},
journal= {arXiv preprint arXiv:2511.08206},
year = {2026}
}
备注
28pages, 6 figures, 6 tables