基于完形填空驱动的注意力网络预训练
计算与语言
2019-03-20 v1
摘要
我们提出了一种预训练双向 transformer 模型的新方法,该方法在多种语言理解任务上取得了显著的性能提升。我们的模型解决了一个完形填空式的词重建任务,其中每个词被遮蔽,必须根据文本的其余部分进行预测。实验表明,在 GLUE 上取得了大幅性能提升,并在 NER 以及成分句法分析基准上达到了新的 SOTA 结果,与同期提出的 BERT 模型一致。我们还详细分析了影响有效预训练的若干因素,包括数据领域与规模、模型容量以及完形填空目标函数的变体。
引用
@article{arxiv.1903.07785,
title = {Cloze-driven Pretraining of Self-attention Networks},
author = {Alexei Baevski and Sergey Edunov and Yinhan Liu and Luke Zettlemoyer and Michael Auli},
journal= {arXiv preprint arXiv:1903.07785},
year = {2019}
}