使用大语言模型自动化从芬兰电子健康记录中检索临床信息
计算与语言
2026-03-30 v1
摘要
临床医生经常需要从电子健康记录(EHR)中检索患者特定信息,这是一项耗时且容易出错的任务。我们提出了一种可本地部署的临床上下文问答(CCQA)框架,能够直接通过自然语言查询从 EHR 中回答临床问题,无需外部数据传输。在完全离线条件下,对来自 183 名患者记录的 1,664 个专家标注的问答对进行了基准测试,涵盖了从 4B 到 70B 参数的开源大语言模型(LLM)。数据集以芬兰临床文本为主。在自由文本生成中,Llama-3.1-70B 实现了 95.3% 的准确率和 97.3% 的语义等效问题变体一致性,而较小的 Qwen3-30B-A3B-2507 模型达到了可比性能。在多项选择设置中,模型表现出类似的准确率但校准度各异。低精度量化(4 位和 8 位)在保持预测性能的同时降低了 GPU 内存需求并改善了部署可行性。临床评估发现 2.9% 的输出存在临床显著错误,语义等效问题偶尔会产生不一致的响应,包括一种表述正确而另一种包含临床显著错误的情况(占 0.96% 的案例)。这些结果表明,本地托管的开源 LLM 能够通过自然语言查询准确检索 EHR 中的患者特定信息,同时强调了在临床部署中需要验证和人工监督。
引用
@article{arxiv.2603.26434,
title = {Automating Clinical Information Retrieval from Finnish Electronic Health Records Using Large Language Models},
author = {Mikko Saukkoriipi and Nicole Hernandez and Jaakko Sahlsten and Kimmo Kaski and Otso Arponen},
journal= {arXiv preprint arXiv:2603.26434},
year = {2026}
}