中文

归一化传播:一种消除深度网络内部协变量偏移的参数化技术

机器学习 2016-07-13 v6 机器学习

摘要

尽管批量归一化(Batch Normalization, BN)的作者指出并解决了深度网络训练中的一个重要问题——内部协变量偏移(Internal Covariate Shift),但当前的解决方案存在某些缺陷。具体而言,BN在训练期间依赖于批量统计数据进行逐层输入归一化,由于参数值漂移(尤其在初始训练轮次),这导致对隐藏层输入(分布)的均值和标准差的估计在验证时不准确。此外,BN在训练时无法用于批大小为1的情况。我们通过提出一种用于消除内部协变量偏移的非自适应归一化技术来解决这些缺陷,我们称之为归一化传播(Normalization Propagation)。我们的方法不依赖于批量统计,而是使用每一层中均值和标准差的与数据无关的参数化估计,因此与BN相比计算更快。我们利用以下观察:在深度网络中,修正线性单元(Rectified Linear Units)之前的预激活服从高斯分布,并且一旦给定数据集的一阶和二阶统计量被归一化,我们就可以前向传播该归一化,而无需重新计算隐藏层的近似统计量。

关键词

引用

@article{arxiv.1603.01431,
  title  = {Normalization Propagation: A Parametric Technique for Removing Internal Covariate Shift in Deep Networks},
  author = {Devansh Arpit and Yingbo Zhou and Bhargava U. Kota and Venu Govindaraju},
  journal= {arXiv preprint arXiv:1603.01431},
  year   = {2016}
}

备注

11 pages, ICML 2016, appendix added to the last version