中文

通过共享权重再取消共享加速深度模型训练

机器学习 2021-10-11 v1 计算与语言

摘要

我们提出了一种简单高效的 BERT 模型训练方法。我们的方法利用了 BERT 包含重复模块栈(即 transformer 编码器)的特殊结构。我们提出的方法首先在所有重复模块间共享权重训练 BERT 直至某一点,这是为了学习所有重复层间权重共同共享的组件。然后我们停止权重共享并继续训练直至收敛。我们针对简化模型的分析给出了通过共享权重再取消共享进行训练的理论见解。在 BERT 模型上的实证实验表明,我们的方法使训练后的模型性能更优,并显著减少了训练迭代次数。

关键词

引用

@article{arxiv.2110.03848,
  title  = {Speeding up Deep Model Training by Sharing Weights and Then Unsharing},
  author = {Shuo Yang and Le Hou and Xiaodan Song and Qiang Liu and Denny Zhou},
  journal= {arXiv preprint arXiv:2110.03848},
  year   = {2021}
}