中文

教师-学生设定下双层神经网络的随机梯度下降动力学

机器学习 2022-03-28 v2 无序系统与神经网络 统计力学 机器学习

摘要

深度神经网络即使拥有足够参数轻松拟合所有训练数据,也能实现极佳的泛化。我们通过分析教师-学生设定下过参数化双层神经网络的动力学与性能来研究这一现象:其中一个网络(学生)在另一个称为教师网络生成的数据上训练。我们展示了随机梯度下降(SGD)的动力学如何被一组微分方程捕获,并证明该描述在大量输入极限下渐近精确。利用该框架,我们计算了参数多于其教师的学生网络的最终泛化误差。我们发现,当仅训练第一层时,学生的最终泛化误差随网络规模增大而增大;但当两层都训练时,误差保持恒定甚至随规模减小。我们表明这些不同行为根源于 SGD 针对不同激活函数所找到的不同解。我们的结果表明,在神经网络中实现良好泛化超越 SGD 本身的特性,而取决于至少算法、模型架构和数据集之间的相互作用。

关键词

引用

@article{arxiv.1906.08632,
  title  = {Dynamics of stochastic gradient descent for two-layer neural networks in the teacher-student setup},
  author = {Sebastian Goldt and Madhu S. Advani and Andrew M. Saxe and Florent Krzakala and Lenka Zdeborová},
  journal= {arXiv preprint arXiv:1906.08632},
  year   = {2022}
}

备注

9 pages + references + supplemental material. Oral presentation at NeurIPS 2019. arXiv admin note: substantial text overlap with arXiv:1901.09085