运气很重要:理解深度 ReLU 网络的训练动态
机器学习
2019-07-01 v4 机器学习
摘要
我们分析了深度 ReLU 网络的训练动态及其对泛化能力的影响。利用教师-学生设置,我们发现了深度 ReLU 网络中隐藏学生节点接收到的梯度与教师节点激活值之间的一种新颖关系。借助该关系以及教师节点激活值小重叠的假设,我们证明:(1) 权重初始化接近教师节点的学生节点以更快的速率收敛到它们;(2) 在过参数化情形和两层情况下,虽然一小部分幸运节点确实收敛到教师节点,但其他节点的扇出权重收敛到零。该框架为深度学习中过参数化、隐式正则化、彩票假设等多个令人困惑的现象提供了见解。我们通过展示预训练的 VGG11/16 模型的多数 BatchNorm 偏置为负来验证我们的假设。在 (1) 具有高斯输入的随机深度教师网络、(2) 在 CIFAR-10 上预训练的教师网络以及 (3) 广泛的消融研究上的实验验证了我们多个理论预测。
引用
@article{arxiv.1905.13405,
title = {Luck Matters: Understanding Training Dynamics of Deep ReLU Networks},
author = {Yuandong Tian and Tina Jiang and Qucheng Gong and Ari Morcos},
journal= {arXiv preprint arXiv:1905.13405},
year = {2019}
}