以亿词训练仍保持优异性能:BERT 遇见英国国家语料库
计算与语言
2023-05-09 v3
摘要
尽管现代掩码语言模型(LMs)在日益庞大的语料库上训练,我们在此探索将训练规模缩减至一个大小适中但具代表性、均衡良好且公开可用的英文文本来源——英国国家语料库(British National Corpus)——的效果。我们表明,在该精心整理的语料库上进行预训练可以取得优于原始 BERT 模型的性能。我们认为此类语料库作为语言建模基准具有巨大潜力。为展示这一潜力,我们提出了公平、可复现且数据高效的 LM 对比研究,在其中我们评估了若干训练目标与模型架构,并以系统化方式复现了以往的实证结果。我们提出了一种称为 LTG-BERT 的优化 LM 架构。
引用
@article{arxiv.2303.09859,
title = {Trained on 100 million words and still in shape: BERT meets British National Corpus},
author = {David Samuel and Andrey Kutuzov and Lilja Øvrelid and Erik Velldal},
journal= {arXiv preprint arXiv:2303.09859},
year = {2023}
}
备注
Accepted to EACL 2023