Transformer架构中层归一化的研究
机器学习
2020-06-30 v2 计算与语言
机器学习
摘要
Transformer在自然语言处理任务中被广泛使用。然而,要训练Transformer,通常需要精心设计的学习率预热阶段,这被证明对最终性能至关重要,但会减慢优化速度并带来更多超参数调优。本文首先从理论上研究学习率预热阶段为何必要,并表明层归一化的位置十分重要。具体而言,我们利用平均场理论证明,在初始化时,对于原始设计的Post-LN Transformer(将层归一化置于残差块之间),靠近输出层的参数期望梯度较大。因此,对这些梯度使用大学习率会使训练不稳定。预热阶段在实践中有助于避免此问题。另一方面,我们的理论也表明,如果将层归一化置于残差块内部(近来提出的Pre-LN Transformer),梯度在初始化时表现良好。这促使我们去除Pre-LN Transformer训练中的预热阶段。我们在实验中表明,无预热阶段的Pre-LN Transformer在广泛应用上可达到与基线相当的结果,同时所需训练时间和超参数调优显著更少。
引用
@article{arxiv.2002.04745,
title = {On Layer Normalization in the Transformer Architecture},
author = {Ruibin Xiong and Yunchang Yang and Di He and Kai Zheng and Shuxin Zheng and Chen Xing and Huishuai Zhang and Yanyan Lan and Liwei Wang and Tie-Yan Liu},
journal= {arXiv preprint arXiv:2002.04745},
year = {2020}
}