中文

随机初始化 ReLU 网络中的样本方差衰减

机器学习 2019-08-07 v2 机器学习

摘要

在训练神经网络之前,一个经典的经验法则是随机初始化权重,以使激活值的方差在各层间得以保持。这传统上用源于权重与样本两者随机性的总方差来解释。另一种方式是将该经验法则解释为:对固定网络,样本间方差的保持。两种解释对浅层网络差异甚微,但本文通过将总方差分解为样本方差与样本均值平方的网络平均和,表明该差异随深度 ReLU 网络的深度而增长。我们证明,即便总方差被保持,通过无限网络宽度极限下的解析计算与有限宽度的数值模拟,样本方差在后层发生衰减。我们展示批归一化(Batch Normalization)消除了该衰减,并提供经验证据:在初始化时保持样本方差而非仅保持总方差,可对深度网络的训练动态产生影响。

关键词

引用

@article{arxiv.1902.04942,
  title  = {Sample Variance Decay in Randomly Initialized ReLU Networks},
  author = {Kyle Luther and H. Sebastian Seung},
  journal= {arXiv preprint arXiv:1902.04942},
  year   = {2019}
}

备注

Submitted to Neurips2019