中文

均方根层归一化

机器学习 2019-10-17 v1 计算与语言 机器学习

摘要

层归一化(LayerNorm)因其能够处理输入和权重矩阵的重新中心化和重新缩放,已成功应用于各种深度神经网络,以帮助稳定训练并加速模型收敛。然而,LayerNorm 引入的计算开销使得这些改进代价高昂,并显著减慢了底层网络的速度,尤其是 RNN。在本文中,我们假设 LayerNorm 中的重新中心化不变性是可省的,并提出了均方根层归一化,即 RMSNorm。RMSNorm 根据均方根(RMS)对一层中一个神经元的求和输入进行正则化,赋予模型重新缩放不变性属性和隐式学习率自适应能力。RMSNorm 在计算上更简单,因此比 LayerNorm 更高效。我们还提出了部分 RMSNorm,即 pRMSNorm,其中 RMS 是从 p% 的求和输入中估计的,同时不破坏上述属性。在使用多种网络架构的多个任务上进行的大量实验表明,RMSNorm 实现了与 LayerNorm 相当的性能,但在不同模型上将运行时间减少了 7%~64%。源代码可在 https://github.com/bzhangGo/rmsnorm 获取。

关键词

引用

@article{arxiv.1910.07467,
  title  = {Root Mean Square Layer Normalization},
  author = {Biao Zhang and Rico Sennrich},
  journal= {arXiv preprint arXiv:1910.07467},
  year   = {2019}
}

备注

NeurIPS 2019