中文

基于完形填空驱动的注意力网络预训练

计算与语言 2019-03-20 v1

摘要

我们提出了一种预训练双向 transformer 模型的新方法,该方法在多种语言理解任务上取得了显著的性能提升。我们的模型解决了一个完形填空式的词重建任务,其中每个词被遮蔽,必须根据文本的其余部分进行预测。实验表明,在 GLUE 上取得了大幅性能提升,并在 NER 以及成分句法分析基准上达到了新的 SOTA 结果,与同期提出的 BERT 模型一致。我们还详细分析了影响有效预训练的若干因素,包括数据领域与规模、模型容量以及完形填空目标函数的变体。

关键词

引用

@article{arxiv.1903.07785,
  title  = {Cloze-driven Pretraining of Self-attention Networks},
  author = {Alexei Baevski and Sergey Edunov and Yinhan Liu and Luke Zettlemoyer and Michael Auli},
  journal= {arXiv preprint arXiv:1903.07785},
  year   = {2019}
}