锐度感知最小化与稳定性边界
机器学习
2024-06-07 v6 神经与进化计算
机器学习
摘要
最近的实验表明,在使用步长 的梯度下降 (GD) 训练神经网络时,损失函数的 Hessian 算子范数通常会增长直至大约达到 ,之后围绕该值波动。基于损失的局部二次近似的考量,量 被称为“稳定性边界”。我们进行了类似的计算,以得到锐度感知最小化 (SAM) 的“稳定性边界”,SAM 是 GD 的一个变体,已被证明能改善其泛化能力。与 GD 的情况不同,所得的 SAM 边界依赖于梯度的范数。利用三个深度学习训练任务,我们从经验上观察到 SAM 在该分析所确定的稳定性边界上运行。
引用
@article{arxiv.2309.12488,
title = {Sharpness-Aware Minimization and the Edge of Stability},
author = {Philip M. Long and Peter L. Bartlett},
journal= {arXiv preprint arXiv:2309.12488},
year = {2024}
}