随机初始化 ReLU 网络中的样本方差衰减
机器学习
2019-08-07 v2 机器学习
摘要
在训练神经网络之前,一个经典的经验法则是随机初始化权重,以使激活值的方差在各层间得以保持。这传统上用源于权重与样本两者随机性的总方差来解释。另一种方式是将该经验法则解释为:对固定网络,样本间方差的保持。两种解释对浅层网络差异甚微,但本文通过将总方差分解为样本方差与样本均值平方的网络平均和,表明该差异随深度 ReLU 网络的深度而增长。我们证明,即便总方差被保持,通过无限网络宽度极限下的解析计算与有限宽度的数值模拟,样本方差在后层发生衰减。我们展示批归一化(Batch Normalization)消除了该衰减,并提供经验证据:在初始化时保持样本方差而非仅保持总方差,可对深度网络的训练动态产生影响。
引用
@article{arxiv.1902.04942,
title = {Sample Variance Decay in Randomly Initialized ReLU Networks},
author = {Kyle Luther and H. Sebastian Seung},
journal= {arXiv preprint arXiv:1902.04942},
year = {2019}
}
备注
Submitted to Neurips2019