中文

关于大学习率下梯度下降的收敛性

机器学习 2024-12-10 v3

摘要

目前已有大量关于梯度下降及其衍生方法收敛性保证的文献。然而,一个简单的实际情况仍未被探索:当使用固定步长时,我们能否期望梯度下降从任意初始化开始都能收敛?我们提供了基本的不可行性结果,表明如果步长过大,无论初始化如何,收敛都将变得不可能。通过观察优化轨迹上梯度范数的渐近值,我们发现当步长跨越临界值时存在急剧转变。从业者已观察到这一现象,但除了启发式方法外,其发生的真正机制尚不清楚。利用动力系统理论的结果,我们在具有平方损失的线性神经网络情况下对此提供了证明。我们还证明了对于更一般的损失函数,在不要求梯度 Lipschitz 连续性等强假设的情况下,收敛也是不可能的。我们通过非线性网络的实验验证了我们的发现。

关键词

引用

@article{arxiv.2402.13108,
  title  = {On the Convergence of Gradient Descent for Large Learning Rates},
  author = {Alexandru Crăciun and Debarghya Ghoshdastidar},
  journal= {arXiv preprint arXiv:2402.13108},
  year   = {2024}
}