CoRe:一种高效的 BERT 粗—精训练框架
计算与语言
2021-02-19 v2
摘要
近年来,BERT 在许多自然语言处理任务上取得了显著突破并引起了极大关注。尽管精度有所提升,BERT 模型通常包含海量参数且需在大规模数据集上训练,因此训练此类模型在计算上极具挑战且耗时漫长。由此,训练效率应成为一个关键问题。本文提出一种名为 CoRe 的新型粗—精训练框架,以加速 BERT 的训练。具体而言,我们将 BERT 的训练过程分解为两个阶段。在第一阶段,通过引入快速注意力机制并分解前馈网络子层中的大参数,我们构建了一个松弛的 BERT 模型,其参数规模和模型复杂度均远小于原始 BERT,从而可快速训练。在第二阶段,我们将训练好的松弛 BERT 模型转换为原始 BERT 并进一步重训练。得益于松弛模型提供的良好初始化,与从随机初始化从头训练原始 BERT 相比,重训练阶段所需的训练步数大幅减少。实验结果表明,所提出的 CoRe 框架能在不降低性能的前提下大幅缩减训练时间。
引用
@article{arxiv.2011.13633,
title = {CoRe: An Efficient Coarse-refined Training Framework for BERT},
author = {Cheng Yang and Shengnan Wang and Yuechuan Li and Chao Yang and Ming Yan and Jingqiao Zhang and Fangquan Lin},
journal= {arXiv preprint arXiv:2011.13633},
year = {2021}
}