中文

理解与改进层归一化

机器学习 2019-11-19 v1 计算与语言 机器学习

摘要

层归一化(LayerNorm)是一种对中间层分布进行归一化的技术。它使梯度更平滑、训练更快且泛化精度更高。然而,其有效性源自何处仍不清楚。本文的主要贡献是在理解 LayerNorm 方面向前迈进了一步。许多以往研究认为 LayerNorm 的成功来自前向归一化。与它们不同,我们通过重新中心化和重新缩放后向梯度,发现均值与方差的导数比前向归一化更为重要。此外,我们发现 LayerNorm 的参数(包括偏置和增益)增加了过拟合风险,且在大多数情况下不起作用。实验表明,不含偏置和增益的简化版 LayerNorm(LayerNorm-simple)在四个数据集上优于 LayerNorm,并在 En-Vi 机器翻译上取得了 SOTA 性能。为解决过拟合问题,我们提出一种新的归一化方法——自适应归一化(AdaNorm),用新的变换函数替换偏置和增益。实验表明,AdaNorm 在八个数据集中的七个上取得了比 LayerNorm 更好的结果。

关键词

引用

@article{arxiv.1911.07013,
  title  = {Understanding and Improving Layer Normalization},
  author = {Jingjing Xu and Xu Sun and Zhiyuan Zhang and Guangxiang Zhao and Junyang Lin},
  journal= {arXiv preprint arXiv:1911.07013},
  year   = {2019}
}

备注

Accepted by NeurIPS 2019