基于 LLM 的 Prompt Ensemble 用于从 EHR 中可靠地识别医学实体
人工智能
2025-05-27 v2 计算与语言
摘要
电子健康记录 (EHR) 是患者信息的数字记录,常包含非结构化临床文本。命名实体识别 (NER) 是 EHR 中的关键技术,用于提取诸如问题、检验和治疗等关键医学实体,以支持下游临床应用。本文探索了使用大型语言模型 (LLM) 实现基于提示的医学实体识别,具体包括 GPT-4o 和 DeepSeek-R1,受 various prompt engineering 技术指引,包括 zero-shot、few-shot 以及 ensemble 方法。其中,GPT-4o 采用 prompt ensemble 方法在该任务上取得最高的分类性能,F1 分数为 0.95,召回率为 0.98,超越 DeepSeek-R1。该 ensemble 方法通过基于嵌入相似性和多数投票聚合输出,从而提高了可靠性。
引用
@article{arxiv.2505.08704,
title = {LLM-based Prompt Ensemble for Reliable Medical Entity Recognition from EHRs},
author = {K M Sajjadul Islam and Ayesha Siddika Nipu and Jiawei Wu and Praveen Madiraju},
journal= {arXiv preprint arXiv:2505.08704},
year = {2025}
}
备注
IEEE 26th International Conference on Information Reuse and Integration for Data Science (IRI 2025), San Jose, CA, USA