优化器收敛性意味着平衡处的特征值过滤
机器学习
2025-10-13 v1 动力系统
最优化与控制
摘要
深层神经网络训练中已有大量经验表明,各种优化器倾向于找到接近全局最优解。在本文中,我们采用相反的视角,假设收敛到任意点而非证明收敛,关注于这种假设的后果。从这一角度看,结合最近关于边际稳定性现象的最新进展,我们认为,不同的优化器实际上充当由其超参数决定的特征值过滤器。具体而言,标准梯度下降方法天然避免最锋利的极小值,而锐度感知最小化(SAM)算法则进一步主动偏好更宽阔的盆地。鼓舞人心的是,我们提出了两种新型算法,表现出增强的特征值过滤能力,有效促进更宽的极小值。我们的理论分析利用了广义哈德卡-佩森稳定流形定理,适用于一般半代数函数的 函数,无需额外的非退化条件或全局Lipschitz 界限假设。我们通过在前馈神经网络上的数值实验支持了我们的结论。
引用
@article{arxiv.2510.09034,
title = {Convergence of optimizers implies eigenvalues filtering at equilibrium},
author = {Jerome Bolte and Quoc-Tung Le and Edouard Pauwels},
journal= {arXiv preprint arXiv:2510.09034},
year = {2025}
}