深度神经网络早期训练动力学的相图:学习率、深度和宽度的影响
机器学习
2023-10-25 v2 无序系统与神经网络
摘要
我们系统分析了用随机梯度下降(SGD)训练的深度神经网络(DNNs)中的优化动力学,并研究了神经网络学习率 、深度 和宽度 的影响。通过分析损失 Hessian 的最大特征值 (它是损失景观锐度的度量),我们发现动力学可表现出四种不同机制:(i)早期瞬态机制,(ii)中间饱和机制,(iii)渐进锐化机制,以及(iv)晚期“稳定性边缘”机制。早期和中间机制(i)和(ii)展现出依赖于 、 和 的丰富相图。我们确定了 的几个临界值,它们将训练损失和锐度的早期时间动力学中性质不同的现象分开。值得注意的是,我们发现随着 和 增大,会出现一个“锐度降低”相,其中锐度在早期时间内下降。
引用
@article{arxiv.2302.12250,
title = {Phase diagram of early training dynamics in deep neural networks: effect of the learning rate, depth, and width},
author = {Dayal Singh Kalra and Maissam Barkeshli},
journal= {arXiv preprint arXiv:2302.12250},
year = {2023}
}
备注
Accepted at NeurIPS 2023 (camera-ready version): Additional results added for cross-entropy loss and effect on network output at initialization; 10+32 pages, 8+35 figures