深度 ReLU 网络在初始化时过参数化的益处
机器学习
2019-10-03 v3 机器学习
摘要
现有文献已注意到 ReLU 网络中的过参数化通常会提升性能。尽管背后可能涉及若干因素,我们证明了 ReLU 网络在初始化时具备一些可取的理论性质。具体而言,已知在无限宽网络中,深度 ReLU 网络中的 He 初始化在前向传播中渐近地保持激活的方差、在反向传播中保持梯度的方差,从而保持两个方向的信息流。我们的论文超越这些结果,展示了在 He 初始化下成立的新性质:i) 每一层隐藏激活的范数等于输入的范数;ii) 每一层权重梯度的范数等于输入向量范数与输出层误差的乘积。这些结果是利用 PAC 分析框架推导的,并且对有限大小的数据集成立,此时 ReLU 网络的宽度只需大于某个有限下界。如我们所展示的,该下界依赖于网络深度和样本数量,并且凭借作为下界这一事实,过参数化的 ReLU 网络被赋予了这些可取的性质。对于上述 He 初始化下的隐藏激活范数性质,我们进一步拓展理论,表明即使数据样本数量无限,该性质对有限宽网络也成立。因此我们克服了现有论文的若干局限,并展示了深度 ReLU 网络在初始化时的新性质。
引用
@article{arxiv.1901.03611,
title = {The Benefits of Over-parameterization at Initialization in Deep ReLU Networks},
author = {Devansh Arpit and Yoshua Bengio},
journal= {arXiv preprint arXiv:1901.03611},
year = {2019}
}