中文

渐进堆叠 2.0:一种用于加速 BERT 训练的多阶段逐层训练方法

计算与语言 2020-11-30 v1

摘要

预训练语言模型(如 BERT)已在许多自然语言处理任务中取得显著的精度提升。尽管有效,其庞大的参数量使 BERT 模型的训练在计算上极具挑战。本文提出一种高效的多阶段逐层训练(MSLT)方法以降低 BERT 的训练时间。我们将整体训练过程分解为若干阶段。训练从仅含少数编码器层的小模型开始,并逐步通过添加新编码器层来增加模型深度。在每个阶段,我们仅训练顶部(靠近输出层)少数新添加的编码器层。此前阶段已训练的其他层参数在当前阶段不予更新。在 BERT 训练中,反向计算远比正向计算耗时,尤其在分布式训练设定下,反向计算时间还包含梯度同步的通信时间。在所提训练策略中,仅顶部少数层参与反向计算,而多数层仅参与正向计算。因此计算与通信效率均大幅提升。实验结果表明,所提方法可实现超过 110% 的训练加速而无显著性能下降。

关键词

引用

@article{arxiv.2011.13635,
  title  = {Progressively Stacking 2.0: A Multi-stage Layerwise Training Method for BERT Training Speedup},
  author = {Cheng Yang and Shengnan Wang and Chao Yang and Yuechuan Li and Ru He and Jingqiao Zhang},
  journal= {arXiv preprint arXiv:2011.13635},
  year   = {2020}
}