中文

EarlyBERT:基于早鸟彩票的高效 BERT 训练方法

计算与语言 2021-06-09 v2 人工智能

摘要

诸如 BERT、XLNet 和 T5 等重度过参数化的语言模型已在许多 NLP 任务中取得令人瞩目的成功。然而,其高模型复杂度需要庞大的计算资源以及极长的预训练与微调时间。许多工作研究了大型 NLP 模型的模型压缩,但仅聚焦于降低推理时间,仍需要昂贵的训练过程。其他工作使用极大批量大小来缩短预训练时间,代价是更高的计算资源需求。本文受近期在计算机视觉任务中研究的早鸟彩票(Early-Bird Lottery Tickets)启发,提出 EarlyBERT,一种可应用于大规模语言模型预训练与微调的通用计算高效训练算法。通过剪裁 transformer 内部的自注意力与全连接子层,我们首次在 BERT 训练早期识别出结构化中奖彩票。我们将这些彩票用于高效的 BERT 训练,并在 GLUE 与 SQuAD 下游任务上进行了全面的预训练与微调实验。结果表明,EarlyBERT 取得了与标准 BERT 相当的性能,且训练时间减少 35~45%。代码见 https://github.com/VITA-Group/EarlyBERT。

关键词

引用

@article{arxiv.2101.00063,
  title  = {EarlyBERT: Efficient BERT Training via Early-bird Lottery Tickets},
  author = {Xiaohan Chen and Yu Cheng and Shuohang Wang and Zhe Gan and Zhangyang Wang and Jingjing Liu},
  journal= {arXiv preprint arXiv:2101.00063},
  year   = {2021}
}

备注

Accepted at ACL-IJCNLP 2021