SGD 的极限动力学:修正损失、相空间振荡与反常扩散
机器学习
2023-12-29 v4 统计力学
神经元与认知
机器学习
摘要
在本工作中,我们探究用随机梯度下降(SGD)训练的深度神经网络的极限动力学。如前所述,在性能收敛后很久,网络仍通过反常扩散过程在参数空间中继续移动,其中行进距离随梯度更新次数以非平凡指数的幂律增长。我们揭示了优化超参数、梯度噪声中的结构以及训练结束时的 Hessian 矩阵之间解释此反常扩散的复杂相互作用。为建立此理解,我们首先将具有有限学习率与批量大小的 SGD 推导为欠阻尼朗之万方程的连续时间模型。我们在线性回归设定下研究该方程,从中可从初始化到平稳导出参数及其瞬时速度的相空间动力学的精确解析表达式。利用 Fokker-Planck 方程,我们表明驱动这些动力学的关键成分并非原始训练损失,而是修正损失(其隐式正则化速度)与概率流(其导致相空间中的振荡)的组合。我们在训练于 ImageNet 的 ResNet-18 模型动力学中辨识出该理论的定性与定量预测。通过统计物理的视角,我们揭示了用 SGD 训练的深度神经网络反常极限动力学的机制性起源。
引用
@article{arxiv.2107.09133,
title = {The Limiting Dynamics of SGD: Modified Loss, Phase Space Oscillations, and Anomalous Diffusion},
author = {Daniel Kunin and Javier Sagastuy-Brena and Lauren Gillespie and Eshed Margalit and Hidenori Tanaka and Surya Ganguli and Daniel L. K. Yamins},
journal= {arXiv preprint arXiv:2107.09133},
year = {2023}
}
备注
78 pages, 9 figures, Neural Computation 2024