HILGEN:基于知识库和大型语言模型的生物医学命名实体识别的分层信息数据生成方法
计算与语言
2025-03-10 v1 人工智能
摘要
我们提出了HILGEN,这是一种分层信息数据生成方法,将统一医学语言系统(UMLS)中的领域知识与大型语言模型(LLM)生成的合成数据相结合,具体采用GPT-3.5。该方法利用UMLS的层次结构扩展训练数据,并通过针对稀疏出现的命名实体的精准提示,融合LLM的上下文信息,自动生成合成示例。我们在四个生物医学命名实体识别数据集(MIMIC III、BC5CDR、NCBI-Disease和Med-Mentions)上评估了HILGEN方法的性能,采用BERT-Large和DANN(基于最近邻分类器的数据增强)模型,并应用了包括UMLS、GPT-3.5及其最佳集成在内的多种数据生成策略。对于BERT-Large模型,纳入UMLS后平均F1分数提升40.36%,使用GPT-3.5的结果相当,平均提升40.52%。采用BERT-Large的最佳集成方法实现了最高的提升,平均提升42.29%。DANN模型采用UMLS-only方法时F1分数平均提升22.74%,GPT-3.5基于的方法导致21.53%的提升,最佳集成DANN模型显示更显著的提升,平均提升25.03%。我们提出的HILGEN方法在无需额外手动标注数据的情况下提升了few-shot设置下的命名实体识别性能。我们的实验表明,优化生物医学命名实体识别的有效策略是结合过去整理的生物医学知识(如UMLS)与生成式LLM,以创建合成训练实例。我们的未来研究将致力于探索更多创新的合成数据生成策略,以进一步提升命名实体识别性能。
引用
@article{arxiv.2503.04930,
title = {HILGEN: Hierarchically-Informed Data Generation for Biomedical NER Using Knowledgebases and Large Language Models},
author = {Yao Ge and Yuting Guo and Sudeshna Das and Swati Rajwal and Selen Bozkurt and Abeed Sarker},
journal= {arXiv preprint arXiv:2503.04930},
year = {2025}
}