中文

利用数据增强提升 LLM 从电子健康记录笔记中识别与优先排序重要医学术语的能力

计算与语言 2026-05-08 v2

摘要

OpenNotes 使患者能够访问电子健康记录(EHR)笔记,但医学术语会阻碍理解。为改进理解效果,我们评估了闭源和开源 LLM 的表现,通过提示、微调和数据增强方法提取和优先排序关键医学术语。我们在 106 份专家标注的 EHR 笔记上进行评估,实验包括:(i)通用提示与结构化提示;(ii)零样本提示与少样本提示;(iii)微调;(iv)数据增强。为提升低资源环境下的开源模型,我们使用 ChatGPT 进行数据增强并应用排序技术。我们逐步增加增强数据集的规模(从 10 到 10,000),采用 5 折交叉验证,报告 F1 分数和平均倒数排名(MRR)。我们的结果表明,微调和数据增强的性能优于其他策略。GPT-4 Turbo 实现了最高的 F1(0.433),而使用数据增强的 Mistral7B 获得了最高的 MRR(0.746)。开源模型在微调或数据增强后超越闭源模型。值得注意的是,最佳 F1 和 MRR 分数并不总是一致。少样本提示在基础模型中优于零样本提示,结构化提示在不同模型间导致偏好差异。微调提升了零样本性能,但有时会降低少样本性能。数据增强的表现与其他方法相当或更好。我们的评估凸显了在低资源场景下,通过提示、微调和数据增强提高模型进行医学术语提取性能的有效性。

关键词

引用

@article{arxiv.2502.16022,
  title  = {Enhancing LLMs for Identifying and Prioritizing Important Medical Jargons from Electronic Health Record Notes Utilizing Data Augmentation},
  author = {Won Seok Jang and Sharmin Sultana and Zonghai Yao and Hieu Tran and Zhichao Yang and Sunjae Kwon and Hong Yu},
  journal= {arXiv preprint arXiv:2502.16022},
  year   = {2026}
}

备注

21pages, 5 figures, 4 tables