二次网络中的弹射动力学与相变
机器学习
2025-09-26 v2 人工智能
机器学习
摘要
用梯度下降训练的神经网络会随学习率的变化经历非平凡的相变。在\cite{lewkowycz2020large}中发现,宽神经网络在超临界学习率下会表现出弹射相,此时训练损失在早期呈指数级快速增长,随后迅速下降至较小值。在此相期间,神经正切核(NTK)的最大特征值也经历显著演化。本工作中,我们将证明弹射相存在于一大类模型中,包括二次模型和两层齐次神经网络。为此,我们证明对于某一学习率范围,当损失变大时权重范数减小。我们还对超出该理论推导范围的学习率进行了实证研究中,表明用超临界学习率训练的ReLU网络的激活图随学习率增大而愈发稀疏。
引用
@article{arxiv.2301.07737,
title = {Catapult Dynamics and Phase Transitions in Quadratic Nets},
author = {David Meltzer and Min Chen and Junyu Liu},
journal= {arXiv preprint arXiv:2301.07737},
year = {2025}
}
备注
46 pages, many figures