中文

PrecLLM:一种面向非结构化电子健康记录的高效临床标注提取隐私保护框架

人工智能 2026-03-24 v3

摘要

大型语言模型(LLM)在自然语言处理中的自动文本标注方面展现出惊人的能力。然而,其在临床环境中的部署受到严格的隐私法规和处理大量非结构化电子健康记录(EHR)的高昂计算成本的限制。本研究开发了一种可采用于现有 LLM 流程的资源高效预处理技术。该方法特别适用于常因准确性受限而属于小规模 LLM,构成了一个针对计算环境严格隐私要求且缺乏高性能 GPU 访问的紧凑型 LLM 框架(PrecLLM)。预处理步骤包括正则表达式(regex)和检索增强生成(RAG),用于从非结构化临床笔记中提取和突出显示关键信息。对长非结构化文本进行预筛选可显著提升小型 LLM 在 EHR 相关任务上的性能。本次评估在两个不同的队列中完成:一个来自 EPIC 系统的本地精选私有 EHR 数据集用于头颈癌(HNC)队列,以及公开可用 EHR 数据集(MIMIC-IV)。使用 MIMIC-IV,我们进一步将 PrecLLM 与微调 LLM 进行比较。结果表明,PrecLLM 在敏感性、特异性和 F1 分数方面显著提升了原始小型 LLM 的性能,使其非常适用于隐私敏感且资源受限的应用。该研究为本地安全高效的医疗保健应用提供了优化后的 LLM 性能,并在解决隐私、计算可行性和临床适用性挑战方面为临床 LLM 部署提供了实用指导。

关键词

引用

@article{arxiv.2412.02868,
  title  = {PrecLLM: A Privacy-Preserving Framework for Efficient Clinical Annotation Extraction from Unstructured EHRs using Small-Scale LLMs},
  author = {Yixiang Qu and Yifan Dai and Shilin Yu and Pradham Tanikella and Malvika Pillai and Walter Chen and Jialiu Xie and Yishan Ren and Duan Wang and Yikai Wang and Sid Sheth and Guanting Chen and Yufeng Liu and Travis Schrank and Trevor Hackman and Didong Li and Di Wu},
  journal= {arXiv preprint arXiv:2412.02868},
  year   = {2026}
}