预训练语言模型的低成本领域自适应:生物医学命名实体识别与 Covid-19 问答案例研究
计算与语言
2020-06-30 v4
摘要
预训练语言模型(PTLM)的领域自适应通常通过对目标领域文本进行无监督预训练来实现。尽管有效,该方法在硬件、运行时间与 CO_2 排放方面代价高昂。在此,我们提出一种更廉价的替代方案:我们在目标领域文本上训练 Word2Vec,并将所得词向量与通用领域 PTLM 的 wordpiece 向量对齐。我们在八个生物医学命名实体识别(NER)任务上进行了评估,并与近期提出的 BioBERT 模型进行比较。我们以 BioBERT 5% 的 CO_2 足迹和 2% 的云计算成本,覆盖了 BioBERT 相对 BERT 的 F1 差距的 60% 以上。我们还展示了如何将现有的通用领域问答(QA)模型快速自适应到一个新兴领域:Covid-19 大流行。
引用
@article{arxiv.2004.03354,
title = {Inexpensive Domain Adaptation of Pretrained Language Models: Case Studies on Biomedical NER and Covid-19 QA},
author = {Nina Poerner and Ulli Waltinger and Hinrich Schütze},
journal= {arXiv preprint arXiv:2004.03354},
year = {2020}
}