中文

以亿词训练仍保持优异性能:BERT 遇见英国国家语料库

计算与语言 2023-05-09 v3

摘要

尽管现代掩码语言模型(LMs)在日益庞大的语料库上训练,我们在此探索将训练规模缩减至一个大小适中但具代表性、均衡良好且公开可用的英文文本来源——英国国家语料库(British National Corpus)——的效果。我们表明,在该精心整理的语料库上进行预训练可以取得优于原始 BERT 模型的性能。我们认为此类语料库作为语言建模基准具有巨大潜力。为展示这一潜力,我们提出了公平、可复现且数据高效的 LM 对比研究,在其中我们评估了若干训练目标与模型架构,并以系统化方式复现了以往的实证结果。我们提出了一种称为 LTG-BERT 的优化 LM 架构。

关键词

引用

@article{arxiv.2303.09859,
  title  = {Trained on 100 million words and still in shape: BERT meets British National Corpus},
  author = {David Samuel and Andrey Kutuzov and Lilja Øvrelid and Erik Velldal},
  journal= {arXiv preprint arXiv:2303.09859},
  year   = {2023}
}

备注

Accepted to EACL 2023