中文

非消失学习率下 Adam 等自适应随机梯度下降优化方法的非收敛性

机器学习 2024-07-12 v1 最优化与控制 概率论

摘要

深度学习算法——通常由一类深度神经网络通过随机梯度下降(SGD)优化方法训练而成——是当今人工智能(AI)系统中的关键要素,已彻底改变了现代社会中我们的工作和生活方式。例如,SGD 方法用于训练像 ChatGPT 和 Gemini 这类大型语言模型(LLM),也用于创建成功的基于生成 AI 的文本到图像创建模型,如 Midjourney、DALL-E 和 Stable Diffusion;但 SGD 方法也用于训练 DNN 来近似求解来自物理和生物学的偏微分方程(PDE)模型,以及来自工程学的 optimal control 和 stopping problems。已知,标准 SGD 方法即使在几个凸优化问题的情况下,只要学习率远离零,就会收敛失败。然而,在许多实际相关的训练场景中,人们使用的并非标准的 vanilla SGD 方法,而是 RMSprop 和 Adam 等自适应 SGD 方法,其中学习率在训练过程中被动态修改。这自然引出了一个问题:在非消失学习率的情况下,这些自适应优化器是否会收敛。本文以否定答案回答了这个问题,通过证明当学习率在渐进上远离零时,像 Adam 这样的自适应 SGD 方法会收敛到任何可能的随机极限点。我们非收敛结果的证明中,我们为一类加速和自适应 SGD 方法建立了合适的路径相关先验界限,这些界限也具有独立的兴趣。

关键词

引用

@article{arxiv.2407.08100,
  title  = {Non-convergence of Adam and other adaptive stochastic gradient descent optimization methods for non-vanishing learning rates},
  author = {Steffen Dereich and Robin Graeber and Arnulf Jentzen},
  journal= {arXiv preprint arXiv:2407.08100},
  year   = {2024}
}

备注

54 pages