中文

多层神经网络中随机梯度下降的相图与特征值动力学

无序系统与神经网络 2025-12-12 v2 机器学习 高能物理 - 格点

摘要

超参数调优是保证机器学习模型收敛的关键步骤之一。我们认为,通过研究神经网络的相图,可以获得关于随机梯度下降超参数最优选择的直觉,其中每个相由权重矩阵奇异值的独特动力学特征所表征。受无序系统的启发,我们从以下观察出发:具有均方误差的多层神经网络的损失景观可以解释为特征空间中的无序系统,其中学习到的特征被映射到软自旋自由度,权重矩阵的初始方差被解释为无序强度,而温度则由学习率与批次大小的比率给出。随着模型的训练,可以识别出三个相,其中权重矩阵的动力学在性质上是不同的。利用先前使用戴森布朗运动推导出的随机梯度下降的朗之万方程,我们证明这三种动力学区域可以被有效分类,为优化器超参数的选择提供了实践指导。

关键词

引用

@article{arxiv.2509.01349,
  title  = {Phase diagram and eigenvalue dynamics of stochastic gradient descent in multilayer neural networks},
  author = {Chanju Park and Biagio Lucini and Gert Aarts},
  journal= {arXiv preprint arXiv:2509.01349},
  year   = {2025}
}

备注

27 pages, many figures, references updated