ReZero 即所需:大深度下的快速收敛
机器学习
2020-06-26 v2 计算与语言
机器学习
摘要
深度网络常因信号传播低效而遭受梯度消失或爆炸,导致训练时间长或收敛困难。各种架构设计、复杂的残差风格网络以及初始化方案已被证明可改善深度信号传播。最近,Pennington 等人利用自由概率理论表明,动态等距在高效深度学习中起着不可或缺的作用。我们证明,使用单个零初始化参数对每个残差连接进行门控这一最简单的架构改变,即可满足初始动态等距,并优于更复杂的方法。尽管比其前身简单得多,该门控能够训练数千个全连接层,并在 CIFAR-10 上训练的 ResNet 上实现快速收敛与更好的测试性能。我们将该技术应用于语言建模,发现可以轻松训练 120 层 Transformer。当应用于 12 层 Transformer 时,其在 enwiki8 上收敛速度加快 56%。
引用
@article{arxiv.2003.04887,
title = {ReZero is All You Need: Fast Convergence at Large Depth},
author = {Thomas Bachlechner and Bodhisattwa Prasad Majumder and Huanru Henry Mao and Garrison W. Cottrell and Julian McAuley},
journal= {arXiv preprint arXiv:2003.04887},
year = {2020}
}