BIOptimus:采用课程学习预训练最优生物医学语言模型用于命名实体识别
计算与语言
2023-08-21 v1
摘要
利用在大型语料上自监督预训练的语言模型(LM)再微调下游任务,有助于解决命名实体识别(NER)等监督学习任务中标签数据有限的问题。生物医学语言处理近期研究提出了若干采用不同方法预训练的生物医学LM,提升了包括NER在内的许多BioNLP任务结果。然而,仍缺乏在生物医学领域更有效工作的预训练方法的综合比较。本文旨在研究不同预训练方法,如从零预训练生物医学LM和以持续方式预训练。我们将现有方法与提出的预训练方法比较:通过从BERT模型中发现这些新词所在上下文的已有权重进行蒸馏,来初始化新词权重。该方法加速了预训练阶段并提升了NER性能。此外,我们比较了掩码率、破坏策略和掩码策略如何影响生物医学LM的性能。最后,基于实验洞见,我们引入了采用课程学习(CL)和上下文权重蒸馏方法预训练的新生物医学LM(BIOptimus)。我们的模型在多个生物医学命名实体识别(NER)任务上确立了新的最优水平。我们发布了代码与所有预训练模型。
引用
@article{arxiv.2308.08625,
title = {BIOptimus: Pre-training an Optimal Biomedical Language Model with Curriculum Learning for Named Entity Recognition},
author = {Pavlova Vera and Mohammed Makhlouf},
journal= {arXiv preprint arXiv:2308.08625},
year = {2023}
}