中文

有限宽度与输入维度下深度 ReLU 网络中的学生专门化

机器学习 2020-06-30 v6 机器学习

摘要

我们考虑一个深度 ReLU / Leaky ReLU 学生网络,通过随机梯度下降(SGD)从同深度固定教师网络的输出进行训练。学生网络是\emph{过实现的}:在每一层 ll,学生节点数 nln_l 多于教师节点数(mlm_l)。在数据集和教师网络的温和条件下,我们证明当每个数据样本处的梯度都很小时,每个教师节点在\emph{最低层}至少被一个学生节点\emph{专门化}。对于两层网络,这种专门化可通过在\emph{多项式}规模 O(K5/2d3ϵ1)\mathcal{O}( K^{5/2} d^3 \epsilon^{-1}) 的任何数据集上训练实现,直至梯度幅值降至 O(ϵ/K3/2d)\mathcal{O}(\epsilon/K^{3/2}\sqrt{d})。此处 dd 为输入维度,K=m1+n1K = m_1 + n_1 为教师与学生最低层神经元总数。注意我们需要一种特定形式的数据增强,且样本复杂度包含增强生成的额外数据。据我们所知,我们首次给出了在教师-学生设定下训练具有有限深度和宽度的两层(Leaky)ReLU 网络的学生专门化的多项式样本复杂度,以及多层情况下最低层专门化的有限复杂度,且不对输入做参数化假设(如高斯)。我们的理论表明,具有大扇出权重的教师节点在梯度仍大时首先被专门化,而其他节点在梯度小时被专门化,这暗示了训练中的归纳偏置。这塑造了如先前多项工作所实证观察到的训练阶段。在合成数据与 CIFAR10 上的实验验证了我们的发现。代码发布于 https://github.com/facebookresearch/luckmatters。

关键词

引用

@article{arxiv.1909.13458,
  title  = {Student Specialization in Deep ReLU Networks With Finite Width and Input Dimension},
  author = {Yuandong Tian},
  journal= {arXiv preprint arXiv:1909.13458},
  year   = {2020}
}

备注

Accepted in ICML 2020