论现代语言模型的损失函数
计算与语言
2020-10-06 v1 机器学习
摘要
BERT 通过在两个任务上预训练——掩码语言建模(MLM)与下一句预测(NSP)——在多种 NLU 基准上确立了诸多最先进结果,其中后者饱受批评。本文中,我们 1)厘清 NSP 对 BERT 预训练的影响,2)探索十四种可能的辅助预训练任务,其中七种对现代语言模型而言是新颖的,以及 3)研究将多任务纳入预训练的不同方式。我们表明,NSP 因其上下文切分与浅层语义信号而不利于训练。我们还识别出六种优于纯 MLM 基线的辅助预训练任务——句子排序、相邻句预测、TF 预测、TF-IDF 预测、一种 FastSent 变体以及一种 Quick Thoughts 变体。最后,我们证明在多任务预训练框架中使用多个任务比使用任何单一辅助任务效果更好。使用这些方法,我们以少于四分之一的训练 token 在 GLUE 基准上超越了 BERT Base。
引用
@article{arxiv.2010.01694,
title = {On Losses for Modern Language Models},
author = {Stephane Aroca-Ouellette and Frank Rudzicz},
journal= {arXiv preprint arXiv:2010.01694},
year = {2020}
}
备注
Accepted to EMNLP 2020. 9 Pages + 3 Pages of References and Appendices (12 Pages total)