理解与改进层归一化
机器学习
2019-11-19 v1 计算与语言
机器学习
摘要
层归一化(LayerNorm)是一种对中间层分布进行归一化的技术。它使梯度更平滑、训练更快且泛化精度更高。然而,其有效性源自何处仍不清楚。本文的主要贡献是在理解 LayerNorm 方面向前迈进了一步。许多以往研究认为 LayerNorm 的成功来自前向归一化。与它们不同,我们通过重新中心化和重新缩放后向梯度,发现均值与方差的导数比前向归一化更为重要。此外,我们发现 LayerNorm 的参数(包括偏置和增益)增加了过拟合风险,且在大多数情况下不起作用。实验表明,不含偏置和增益的简化版 LayerNorm(LayerNorm-simple)在四个数据集上优于 LayerNorm,并在 En-Vi 机器翻译上取得了 SOTA 性能。为解决过拟合问题,我们提出一种新的归一化方法——自适应归一化(AdaNorm),用新的变换函数替换偏置和增益。实验表明,AdaNorm 在八个数据集中的七个上取得了比 LayerNorm 更好的结果。
引用
@article{arxiv.1911.07013,
title = {Understanding and Improving Layer Normalization},
author = {Jingjing Xu and Xu Sun and Zhiyuan Zhang and Guangxiang Zhao and Junyang Lin},
journal= {arXiv preprint arXiv:1911.07013},
year = {2019}
}
备注
Accepted by NeurIPS 2019