Transformer的高效预训练目标
计算与语言
2021-04-21 v1 信息检索
机器学习
摘要
Transformer架构深刻改变了自然语言处理,超越了此前所有最先进的模型。然而,诸如BERT、RoBERTa与GPT-2等知名Transformer模型需要巨大的计算预算来创建高质量的上下文表示。本文中,我们研究了若干面向基于Transformer模型的的高效预训练目标。通过在不同任务上测试这些目标,我们确定了ELECTRA模型新特性中哪一项最为关键。我们确认,当输入不含掩码令牌且利用全部输出计算损失时,Transformer预训练得到提升且训练时间缩短。此外,受ELECTRA启发,我们研究了一个由两块组成的模型:一个判别器与一个基于统计模型、对计算性能无影响的简单生成器。另外,我们证明消除MASK令牌以及在损失计算中考虑全部输出是提升性能的必要选择。进而,我们展示可以像ELECTRA那样使用判别式方法高效训练BERT类模型,而无需昂贵复杂生成器。最后,我们表明ELECTRA极大受益于最先进的超参数搜索。
引用
@article{arxiv.2104.09694,
title = {Efficient pre-training objectives for Transformers},
author = {Luca Di Liello and Matteo Gabburo and Alessandro Moschitti},
journal= {arXiv preprint arXiv:2104.09694},
year = {2021}
}