SciBERT:一种面向科学文本预训练的语言模型
计算与语言
2019-09-12 v3
摘要
在科学领域获取大规模标注数据用于NLP任务具有挑战性且成本高昂。我们发布了SciBERT,一种基于BERT(Devlin et al., 2018)的预训练语言模型,以应对缺乏高质量、大规模标注科学数据的问题。SciBERT利用对大规模多领域科学文献语料的无监督预训练来提升下游科学NLP任务的性能。我们在包括序列标注、句子分类和依存句法分析在内的一系列任务上进行了评估,所用数据集来自多个科学领域。我们展示了相对于BERT具有统计显著的提升,并在其中若干任务上取得了新的SOTA结果。代码与预训练模型可在 https://github.com/allenai/scibert/ 获取。
引用
@article{arxiv.1903.10676,
title = {SciBERT: A Pretrained Language Model for Scientific Text},
author = {Iz Beltagy and Kyle Lo and Arman Cohan},
journal= {arXiv preprint arXiv:1903.10676},
year = {2019}
}
备注
https://github.com/allenai/scibert