中文

大学习率梯度下降的特殊性质

机器学习 2023-02-17 v2 最优化与控制

摘要

在训练神经网络时,已被广泛观察到大步长对随机梯度下降(SGD)获得优越模型至关重要。然而,大步长对 SGD 成功的作用在理论上尚未被充分理解。若干先前工作将此成功归因于 SGD 中存在的随机噪声。但我们通过一组新颖实验表明,随机噪声不足以解释良好的非凸训练,反而是大学习率本身的作用对获得最佳性能至关重要。我们在无噪声情形(即全批量 GD)中也展示了相同效应。我们形式化证明,在某些非凸函数类上,大步长 GD 遵循与小步长 GD 不同的轨迹,从而可收敛至全局极小而非局部极小。我们的设定为未来分析提供了框架,得以基于传统设定中无法观测的行为比较算法。

关键词

引用

@article{arxiv.2205.15142,
  title  = {Special Properties of Gradient Descent with Large Learning Rates},
  author = {Amirkeivan Mohtashami and Martin Jaggi and Sebastian Stich},
  journal= {arXiv preprint arXiv:2205.15142},
  year   = {2023}
}

备注

A short version of this work appeared in ICML 22 ICML Workshop on Continuous Time Methods for Machine Learning under the title "The Gap Between Continuous and Discrete Gradient Descent"