BioALBERT:一种简洁高效的用于生物医学命名实体识别的预训练语言模型
计算与语言
2020-09-22 v1
摘要
近年来,随着生物医学文献数量的增长与自然语言处理算法的进步,关于生物医学命名实体识别(BioNER)的研究呈指数增长。然而,BioNER研究具有挑战性,因为生物医学领域的NER存在:(i)常因训练数据有限而受限,(ii)实体可依据上下文指代多种类型与概念,以及(iii)严重依赖子领域特定的缩略语。现有BioNER方法常忽视这些问题,直接采用在通用语料上训练的当前最优(SOTA)模型,往往产生不尽人意的结果。我们提出生物医学ALBERT(用于生物医学文本挖掘的轻量双向Transformer编码器表示) bioALBERT,一种在大规模生物医学语料上训练的有效领域特定语言模型,旨在捕捉生物医学上下文相关的NER。我们采用了ALBERT中用于建模句间一致性的自监督损失,以更好地学习上下文相关表示,并引入参数削减技术以降低内存消耗并提升BioNER中的训练速度。在我们的实验中,BioALBERT在八个具四种不同实体类型的生物医学NER基准数据集上优于对比的SOTA BioNER模型。我们训练了四种不同变体的BioALBERT模型,可供研究界用于未来研究。
引用
@article{arxiv.2009.09223,
title = {BioALBERT: A Simple and Effective Pre-trained Language Model for Biomedical Named Entity Recognition},
author = {Usman Naseem and Matloob Khushi and Vinay Reddy and Sakthivel Rajendran and Imran Razzak and Jinman Kim},
journal= {arXiv preprint arXiv:2009.09223},
year = {2020}
}
备注
7 pages