权重衰减是否增强训练稳定性?
机器学习
2026-05-19 v1 最优化与控制
机器学习
摘要
在现代深度学习中,权重衰减常被归因于"稳定"训练动力学,与其经典作用作为静态正则化惩罚不同。我们研究了一个根本性问题:*权重衰减是否稳定训练动力学,若果如此,其机制为何?*确实,训练稳定性在文献中通过不同但相关的概念来理解。我们考察权重衰减如何影响参数空间动力学和损失锋利度,通过分析其在"稳定边缘" (Edge of Stability, EoS) 处的影响。我们表明,权重衰减能够稳健地减缓*渐进式锋利化*。此外,我们发现一种惊人的与网络结构相关的相变。对于卷积神经网络 (CNN),权重衰减可抑制EoS处的振荡;而对于多层感知器 (MLP),增加权重衰减会导致锋利度在显著低于理论 边界的阈值处稳定。我们发展了一种准确建模这些现象的数学框架,并识别出参数向量与锋利度梯度的全局对齐作为相变的机制驱动力。重要的是,我们表明这些现象转化为函数空间 (NTK) 中的搜索稳定性。最后,这表明基于凸/二次启发式获取的曲率阈值可能在正则化下不可靠的稳定性诊断工具。
引用
@article{arxiv.2605.16622,
title = {Does Weight Decay Enhance Training Stability?},
author = {Marius Saether and Amir Kolic and Tomaso Poggio and Pierfrancesco Beneventano},
journal= {arXiv preprint arXiv:2605.16622},
year = {2026}
}
备注
24 pages, 16 figures