利用通用领域资源增强生物医学命名实体识别
摘要
训练基于神经网络的生物医学命名实体识别 (BioNER) 模型通常需要大量且昂贵的人工标注。虽然已有多项研究采用多任务学习结合多个 BioNER 数据集以减少人力成本,但该方法并不一致地产生性能提升,可能在不同生物医学语料中引入标签歧义。我们通过从可轻易获取的资源进行迁移学习来应对这些挑战,这些资源与生物医学数据集的概念重叠较少。我们提出了 GERBERA(General-domain Enhanced Resource for Biomedical Named Entity Recognition),该方法利用通用领域 NER 数据集进行训练。我们对预训练的生物医学语言模型进行多任务学习,同时包括目标 BioNER 数据集和通用领域数据集。随后,我们针对 BioNER 数据集进行针对性微调。我们在五个包含 81,410 个实例的生物医学数据集上系统地评估了 GERBERA。尽管使用了更少的生物医学资源,我们的模型仍显示出优于基线模型的性能。具体而言,我们的模型在八个实体类型中 consistently 超过基线模型,平均提升了 0.9%。我们的 method 在数据有限的 BioNER 数据集上表现尤为突出,在 JNLPBA-RNA 数据集上 F1 分数提升了 4.7%。本研究引入了一种新方法,利用成本效益高的通用领域 NER 数据集来增强 BioNER 模型。该方法显著提高了 BioNER 模型性能,在数据稀缺或成本高昂的场景中具有重要价值。
引用
@article{arxiv.2406.10671,
title = {Augmenting Biomedical Named Entity Recognition with General-domain Resources},
author = {Yu Yin and Hyunjae Kim and Xiao Xiao and Chih Hsuan Wei and Jaewoo Kang and Zhiyong Lu and Hua Xu and Meng Fang and Qingyu Chen},
journal= {arXiv preprint arXiv:2406.10671},
year = {2024}
}
备注
Published in JBI 2024. We make data, codes, and models publicly available via https://github.com/qingyu-qc/bioner_gerbera