梯度下降 instability 是否有益?通过稳定性分析实现更好的泛化
机器学习
2024-12-24 v1 机器学习
摘要
传统的梯度下降优化分析表明,当损失 Hessian 最大特征值(常称为锐度)低于关键学习率阈值时,训练将保持``稳定'',且训练损失单调下降。然而近期研究表明,大多数现代深度神经网络尽管处于非稳定 regime,仍能取得好性能。本文我们证明,这些由大学习率引发的不稳定现象会将模型参数引向损失景观中更平坦的区域。我们的关键洞察在于,针对这些不稳定现象,Hessian 特征向量的方向会发生旋转。这一现象我们推断为,模型得以探索那些对泛化更具期望几何属性的区域,如平坦性。这种旋转是网络深度的结果,我们证明任何深度大于1的网络,参数的不稳定增长会导致 Hessian 主成分发生旋转,从而促进参数空间远离不稳定方向的探索。我们的实证研究揭示了梯度下降在大学习率下运行(超出稳定阈值)时的隐式正则化效应。我们发现,这些现象在现代基准数据集上表现出卓越的泛化性能。
引用
@article{arxiv.2412.17613,
title = {Can Stability be Detrimental? Better Generalization through Gradient Descent Instabilities},
author = {Lawrence Wang and Stephen J. Roberts},
journal= {arXiv preprint arXiv:2412.17613},
year = {2024}
}