良好正则性产生大学习率隐式偏置:稳定性边缘、平衡与弹射
机器学习
2023-12-13 v2 动力系统
最优化与控制
机器学习
摘要
大学习率应用于非凸优化的梯度下降时,会产生各种隐式偏置,包括稳定性边缘(Cohen 等,2021)、平衡(Wang 等,2022)和弹射(Lewkowycz 等,2020)。这些现象无法被经典优化理论很好解释。尽管在理解这些隐式偏置方面已取得显著理论进展,但对于哪些目标函数更可能出现它们仍不清楚。本文为回答该问题提供了初步步骤,并表明这些隐式偏置事实上是同一冰山的不同尖角。为建立这些结果,我们针对一类不具有全局 Lipschitz 连续梯度(现有收敛分析通常假设的)的非凸函数,发展了大学习率下的全局收敛理论。具体而言,当优化目标函数具有良好正则性时,这些现象更可能出现。该正则性,结合偏好平坦区域的大学习率梯度下降,导致了这些非平凡的动力学行为。另一个推论是首个针对非凸函数大学习率梯度下降优化的非渐近收敛速率界。尽管我们的理论目前仅适用于特定函数,将其外推到神经网络的可能性也通过实验得到验证,对此不同的损失选择、激活函数以及其他技术如批量归一化都能显著影响其正则性并导致非常不同的训练动力学。
引用
@article{arxiv.2310.17087,
title = {Good regularity creates large learning rate implicit biases: edge of stability, balancing, and catapult},
author = {Yuqing Wang and Zhenghao Xu and Tuo Zhao and Molei Tao},
journal= {arXiv preprint arXiv:2310.17087},
year = {2023}
}