中文

高维双层神经网络中随机梯度下降的相图

机器学习 2023-06-16 v4 无序系统与神经网络 机器学习

摘要

尽管存在非凸优化地形,过参数化浅层网络能够在梯度下降下实现全局收敛。对于窄网络,情况可能截然不同,它们往往陷入泛化能力差的局部极小值。在此,我们研究高维设定下这两种机制之间的交叉过渡,特别考察所谓平均场/流体动力学机制与 Saad & Solla 开创性方法之间的联系。聚焦于高斯数据情形,我们研究高维随机梯度下降(SGD)动态中学习率、时间尺度与隐藏单元数目之间的相互作用。我们的工作建立在统计物理中高维 SGD 的确定性描述之上,我们对其进行了扩展并给出了严格的收敛速率。

关键词

引用

@article{arxiv.2202.00293,
  title  = {Phase diagram of Stochastic Gradient Descent in high-dimensional two-layer neural networks},
  author = {Rodrigo Veiga and Ludovic Stephan and Bruno Loureiro and Florent Krzakala and Lenka Zdeborová},
  journal= {arXiv preprint arXiv:2202.00293},
  year   = {2023}
}

备注

20 pages