中文

大语言模型导出的合成归一化提及如何提高疾病实体识别与归一化

计算与语言 2024-10-11 v1 机器学习

摘要

背景:临床命名实体识别和实体归一化系统的机器学习方法可同时利用标记的语料库和知识图谱(KGs)进行学习。然而,频繁出现的概念在训练语料库中可能只有少量提及,且在大型知识图谱中缺乏详细描述或同义词,这会导致疾病实体识别(DER)和疾病实体归一化(DEN)的训练样本质量较差。大语言模型(LLM)生成包含归一化提及的合成语料库可能会改善这些信息抽取任务的性能。方法:我们微调了LLaMa-2 13B Chat LLM,用于生成包含来自统一医学语言系统(UMLS)疾病语义组概念的归一化提及的合成语料库。我们测量了DER和DEN的总体性能和超出分布(OOD)性能,分别在有无合成数据增强的情况下进行评估。我们在3个不同的疾病语料库上进行评估,使用4种不同的数据增强策略,分别使用BioBERT进行DER评估,使用SapBERT和KrissBERT进行DEN评估。结果:我们的合成数据对DEN显著性地提升了所有3个训练语料库中SapBERT和KrissBERT的顶级准确率,总体性能提升了3-9分,OOD数据提升了20-55分。也见证了DER中1-2分的小幅提升,仅一个数据集显示出OOD提升。结论:LLM生成归一化疾病提及可改善DEN性能,相对于不使用LLM来增强包含合成提及的数据的归一化方法。消除研究表明,DEN的性能提升仅部分归因于OOD性能的改善。相同方法对DER的提升能力有限。我们公开了软件和数据集。

关键词

引用

@article{arxiv.2410.07951,
  title  = {Disease Entity Recognition and Normalization is Improved with Large Language Model Derived Synthetic Normalized Mentions},
  author = {Kuleen Sasse and Shinjitha Vadlakonda and Richard E. Kennedy and John D. Osborne},
  journal= {arXiv preprint arXiv:2410.07951},
  year   = {2024}
}

备注

21 pages, 3 figures, 7 tables