GLiNER-BioMed:用于开放生物医学命名实体识别的高效模型套件
计算与语言
2025-05-22 v2
摘要
生物医学命名实体识别(NER)因专业术语、海量实体以及不断出现的新颖实体而面临独特挑战。传统NER模型受限于固定的术语表和人工标注,难以在预定义的实体类型之外进行泛化。为此,我们引入GLiNER-BioMed,一套专为生物医学领域定制的通用且轻量级NER模型。与常规方法不同,GLiNER使用自然语言标签推断任意实体类型,实现零样本识别。我们的 метод首先将大型语言模型(LLM)的标注能力蒸馏到更小更高效的模型中,以生成高覆盖率的合成生物医学NER数据。随后,我们在多个规模上训练两种GLiNER架构(uni-encoder和bi-encoder),以计算效率和识别性能之间进行平衡。实验表明,GLiNER-BioMed在零样本和少样本场景中均优于最先进的方法,F1分数提升5.96%(p<0.001)。消融研究表明,我们的合成数据生成策略有效,且合成生物医学预训练与通用领域微调具有互补优势。所有数据集、模型和训练流程已公开于https://github.com/ds4dh/GLiNER-biomed。
关键词
引用
@article{arxiv.2504.00676,
title = {GLiNER-BioMed: A Suite of Efficient Models for Open Biomedical Named Entity Recognition},
author = {Anthony Yazdani and Ihor Stepanov and Douglas Teodoro},
journal= {arXiv preprint arXiv:2504.00676},
year = {2025}
}