中文

RoBERTa:一种鲁棒优化的 BERT 预训练方法

计算与语言 2019-07-29 v1

摘要

语言模型预训练已带来显著的性能提升,但不同方法之间的仔细比较具有挑战性。训练在计算上代价高昂,常在规模不同的私有数据集上进行,并且正如我们将展示的,超参数选择对最终结果有显著影响。我们提出了一项 BERT 预训练(Devlin 等人,2019)的复现研究,仔细度量了许多关键超参数和训练数据规模的影响。我们发现 BERT 训练明显不足,并且可以匹配或超过在其之后发表的每一个模型的性能。我们的最佳模型在 GLUE、RACE 和 SQuAD 上取得了最先进的结果。这些结果凸显了先前被忽视的设计选择的重要性,并对近期所报告改进的源头提出了疑问。我们发布了我们的模型和代码。

关键词

引用

@article{arxiv.1907.11692,
  title  = {RoBERTa: A Robustly Optimized BERT Pretraining Approach},
  author = {Yinhan Liu and Myle Ott and Naman Goyal and Jingfei Du and Mandar Joshi and Danqi Chen and Omer Levy and Mike Lewis and Luke Zettlemoyer and Veselin Stoyanov},
  journal= {arXiv preprint arXiv:1907.11692},
  year   = {2019}
}