从临床文本中提取患者史:临床大语言模型的比较研究
摘要
提取与患者主诉(Chief Complaint, CC)、目前病史(History of Present Illness, HPI)以及既往史、家族史和社会史(Past, Family, and Social History, PFSH)相关的医疗史实体(Medical History Entities, MHEs),有助于将结构化的临床笔记整理成标准化的电子健康记录(EHR),从而简化后续任务,如连续护理、医学编码和质量指标。微调的临床大语言模型(Clinical Large Language Models, cLLMs)可在确保保护敏感数据(通过本地部署)的同时,协助完成这一过程。本研究评估了cLLMs在识别与CC/HPI/PFSH相关的MHEs方面的性能,并检验了笔记特征对模型准确率的影响。我们在MTSamples存储库中标注了1,449个MHEs,涉及61篇与门诊相关的临床笔记。为识别这些实体,我们对七个最先进的cLLMs进行了微调。此外,我们评估了通过整合问题、检查、治疗以及其他基本医疗实体(Basic Medical Entities, BMEs)来增强模型性能的效果。我们将这些模型的性能与GPT-4o在零样本设置下的表现进行了比较。为进一步了解影响模型准确率的文本特征,我们针对笔记长度、实体长度和分段进行了错误分析。cLLMs在通过20%以上时间减少提取MHEs方面展现了潜力。然而,由于MHEs的多义性以及非医学词汇的频繁参与,许多类型的MHEs检测仍然具有挑战性。经广泛训练的GatorTron和GatorTronS两种cLLMs表现最佳。整合预先识别的BME信息对某些实体的模型性能有所提升。关于文本特征对模型性能的影响,我们发现,实体长度越长识别越困难,笔记长度与错误率不成正比,而结构良好的分段(带标题)有助于提取。
引用
@article{arxiv.2503.23281,
title = {Extracting Patient History from Clinical Text: A Comparative Study of Clinical Large Language Models},
author = {Hieu Nghiem and Tuan-Dung Le and Suhao Chen and Thanh Thieu and Andrew Gin and Ellie Phuong Nguyen and Dursun Delen and Johnson Thomas and Jivan Lamichhane and Zhuqi Miao},
journal= {arXiv preprint arXiv:2503.23281},
year = {2025}
}