训练不稳定性诱导梯度下降的平坦偏置
机器学习
2025-11-18 v1
摘要
梯度下降(GD)的经典分析基于损失海森矩阵最大特征值定义稳定阈值,常称为锋利度。当学习率位于此阈值以下时,训练稳定且损失单调下降。然而,现代深度网络往往在此 regime 之外实现最佳性能。我们证明,此类不稳定性会在GD中诱导隐式偏置,使参数导向损失景观中平坦的区域,从而改善泛化能力。关键机制是特征向量的旋转极性(Rotational Polarity of Eigenvectors, RPE),即在训练不稳定期间,海森矩阵的主特征向量发生几何旋转。这种旋转随学习率而增大,促进探索并可证导致更平坦的最小值。该理论框架可推广至随机GD,其中不稳定性驱动的平坦化仍然存在,其经验效应超过小批量噪声。最后,我们表明,在Adam优化器中恢复不稳定性可进一步提升泛化性能。综上,这些结果阐明了训练不稳定性在深度学习中起构造性作用。
引用
@article{arxiv.2511.12558,
title = {Training Instabilities Induce Flatness Bias in Gradient Descent},
author = {Lawrence Wang and Stephen J. Roberts},
journal= {arXiv preprint arXiv:2511.12558},
year = {2025}
}