高维双层神经网络中随机梯度下降的相图
机器学习
2023-06-16 v4 无序系统与神经网络
机器学习
摘要
尽管存在非凸优化地形,过参数化浅层网络能够在梯度下降下实现全局收敛。对于窄网络,情况可能截然不同,它们往往陷入泛化能力差的局部极小值。在此,我们研究高维设定下这两种机制之间的交叉过渡,特别考察所谓平均场/流体动力学机制与 Saad & Solla 开创性方法之间的联系。聚焦于高斯数据情形,我们研究高维随机梯度下降(SGD)动态中学习率、时间尺度与隐藏单元数目之间的相互作用。我们的工作建立在统计物理中高维 SGD 的确定性描述之上,我们对其进行了扩展并给出了严格的收敛速率。
引用
@article{arxiv.2202.00293,
title = {Phase diagram of Stochastic Gradient Descent in high-dimensional two-layer neural networks},
author = {Rodrigo Veiga and Ludovic Stephan and Bruno Loureiro and Florent Krzakala and Lenka Zdeborová},
journal= {arXiv preprint arXiv:2202.00293},
year = {2023}
}
备注
20 pages