BioNerFlair:基于 Flair 嵌入与序列标注器的生物医学命名实体识别
计算与语言
2020-11-04 v1 信息检索
摘要
动机:生物医学研究文献的激增使得信息检索任务比以往任何时候都更加重要。科学家与研究人员难以找到包含与其相关信息的文章。妥善抽取疾病、药物/化学物、物种、基因/蛋白质等生物医学实体,可显著改善文章筛选,从而更好地提取相关信息。由于基于 transformer 的模型(如 BERT、XLNet、OpenAI、GPT2 等)的进步,BioNer 基准上的性能逐步提升。这些模型结果优异,但计算代价高昂,而利用其他基于上下文字符串的模型与基于 LSTM-CRF 的序列标注器,我们能在领域特定任务上取得更优分数。结果:我们提出 BioNerFlair,一种使用 Flair 加 GloVe 嵌入和双向 LSTM-CRF 序列标注器训练生物医学命名实体识别模型的方法。采用与命名实体识别广泛使用的几乎相同的通用架构,BioNerFlair 优于先前 SOTA 模型。我们在 8 个生物医学命名实体识别基准数据集上实验。相较于当前 SOTA 模型,BioNerFlair 在 BioCreative II 基因提及(BC2GM)语料上取得 90.17 的最佳 F1 分数(此前为 84.72),在 BioCreative IV 化学与药物(BC4CHEMD)语料上取得 94.03(此前 92.36),在 JNLPBA 语料上取得 88.73(此前 78.58),在 NCBI 疾病语料上取得 91.1(此前 89.71),在 Species-800 语料上取得 85.48(此前 78.98),而在 BC5CDR-chem、BC3CDR-disease 和 LINNAEUS 语料上观察到接近最佳的结果。
引用
@article{arxiv.2011.01504,
title = {BioNerFlair: biomedical named entity recognition using flair embedding and sequence tagger},
author = {Harsh Patel},
journal= {arXiv preprint arXiv:2011.01504},
year = {2020}
}