中文

基于PL不等式建立自适应梯度方法线性收敛的方法论

机器学习 2024-07-18 v1 人工智能 最优化与控制 机器学习

摘要

自适应梯度 descent 优化器是训练神经网络模型的标准选择。尽管它们比梯度 descent 更快地收敛并在 practice 中表现出色,但自适应优化器不像 vanilla 梯度 descent 那样被充分理解。一个原因是帮助这些 method 更快收敛的 learning rate 的动态更新也使得其分析更为复杂。特别是,简单梯度 descent 方法在一类 optimization problem 下以线性 rate 收敛,而实践中更快的自适应梯度方法缺乏这种理论保证。Polyak-Łojasiewicz(PL)不等式是已知最弱的一类,对于梯度 descent 及其 momentum 变体已证明线性收敛。因此,本 paper 证明当目标函数 smooth 且满足 PL 不等式时,AdaGrad 和 Adam 两种著名自适应梯度方法均可线性收敛。我们的理论框架遵循简单且统一的方法,可用于 batch 和 stochastic 梯度,potentially 可用于分析其他 Adam 变体的线性收敛。

关键词

引用

@article{arxiv.2407.12629,
  title  = {A Methodology Establishing Linear Convergence of Adaptive Gradient Methods under PL Inequality},
  author = {Kushal Chakrabarti and Mayank Baranwal},
  journal= {arXiv preprint arXiv:2407.12629},
  year   = {2024}
}

备注

Accepted for publication at the main track of 27th European Conference on Artificial Intelligence (ECAI-2024)