中文

深度神经网络早期训练动力学的相图:学习率、深度和宽度的影响

机器学习 2023-10-25 v2 无序系统与神经网络

摘要

我们系统分析了用随机梯度下降(SGD)训练的深度神经网络(DNNs)中的优化动力学,并研究了神经网络学习率 η\eta、深度 dd 和宽度 ww 的影响。通过分析损失 Hessian 的最大特征值 λtH\lambda^H_t(它是损失景观锐度的度量),我们发现动力学可表现出四种不同机制:(i)早期瞬态机制,(ii)中间饱和机制,(iii)渐进锐化机制,以及(iv)晚期“稳定性边缘”机制。早期和中间机制(i)和(ii)展现出依赖于 ηc/λ0H\eta \equiv c / \lambda_0^Hddww 的丰富相图。我们确定了 cc 的几个临界值,它们将训练损失和锐度的早期时间动力学中性质不同的现象分开。值得注意的是,我们发现随着 dd1/w1/w 增大,会出现一个“锐度降低”相,其中锐度在早期时间内下降。

关键词

引用

@article{arxiv.2302.12250,
  title  = {Phase diagram of early training dynamics in deep neural networks: effect of the learning rate, depth, and width},
  author = {Dayal Singh Kalra and Maissam Barkeshli},
  journal= {arXiv preprint arXiv:2302.12250},
  year   = {2023}
}

备注

Accepted at NeurIPS 2023 (camera-ready version): Additional results added for cross-entropy loss and effect on network output at initialization; 10+32 pages, 8+35 figures