有限宽度与输入维度下深度 ReLU 网络中的学生专门化
机器学习
2020-06-30 v6 机器学习
摘要
我们考虑一个深度 ReLU / Leaky ReLU 学生网络,通过随机梯度下降(SGD)从同深度固定教师网络的输出进行训练。学生网络是\emph{过实现的}:在每一层 ,学生节点数 多于教师节点数()。在数据集和教师网络的温和条件下,我们证明当每个数据样本处的梯度都很小时,每个教师节点在\emph{最低层}至少被一个学生节点\emph{专门化}。对于两层网络,这种专门化可通过在\emph{多项式}规模 的任何数据集上训练实现,直至梯度幅值降至 。此处 为输入维度, 为教师与学生最低层神经元总数。注意我们需要一种特定形式的数据增强,且样本复杂度包含增强生成的额外数据。据我们所知,我们首次给出了在教师-学生设定下训练具有有限深度和宽度的两层(Leaky)ReLU 网络的学生专门化的多项式样本复杂度,以及多层情况下最低层专门化的有限复杂度,且不对输入做参数化假设(如高斯)。我们的理论表明,具有大扇出权重的教师节点在梯度仍大时首先被专门化,而其他节点在梯度小时被专门化,这暗示了训练中的归纳偏置。这塑造了如先前多项工作所实证观察到的训练阶段。在合成数据与 CIFAR10 上的实验验证了我们的发现。代码发布于 https://github.com/facebookresearch/luckmatters。
引用
@article{arxiv.1909.13458,
title = {Student Specialization in Deep ReLU Networks With Finite Width and Input Dimension},
author = {Yuandong Tian},
journal= {arXiv preprint arXiv:1909.13458},
year = {2020}
}
备注
Accepted in ICML 2020