超越基础:利用大型语言模型进行细粒度医学实体识别
人工智能
2026-04-21 v1
摘要
从非结构化的医学叙述(如入院记录、出院小结和急诊病历)中提取临床相关信息仍然是临床自然语言处理(NLP)中的一个挑战。医学实体识别(MER)识别嵌入在这些记录中的有意义的概念。大型语言模型(LLM)的最新进展显示出有竞争力的MER性能;然而,评估通常集中在通用实体类型上,对于需要更细粒度提取的现实临床需求提供的效用有限。为了弥补这一差距,我们严格评估了开源LLaMA3模型在18个临床详细类别上的细粒度医学实体识别性能。为了优化性能,我们采用了三种学习范式:零样本、少样本和基于低秩适配(LoRA)的微调。为了进一步增强少样本学习,我们引入了两种基于令牌级和句子级嵌入相似度的示例选择方法,利用预训练的BioBERT模型。与先前评估专有模型(如GPT-4)的零样本和少样本性能或微调不同架构的工作不同,我们通过将所有策略应用于统一的LLaMA3骨干网络来确保方法的一致性,从而能够在不同学习设置之间进行公平比较。我们的结果表明,微调后的LLaMA3在细粒度医学实体提取中分别比零样本和少样本方法高出63.11%和35.63%,达到了81.24%的F1分数。
引用
@article{arxiv.2604.17214,
title = {Beyond the Basics: Leveraging Large Language Model for Fine-Grained Medical Entity Recognition},
author = {Nwe Ni Win and Jim Basilakis and Steven Thomas and Seyhan Yazar and Laura Pierce and Stephanie Liu and Paul M. Middleton and Nasser Ghadiri and X. Rosalind Wang},
journal= {arXiv preprint arXiv:2604.17214},
year = {2026}
}