中文

面向简单且可证明的参数自适应梯度方法

机器学习 2024-12-30 v1 最优化与控制 机器学习

摘要

诸如 AdaGrad 和 Adam 等优化算法通过动态调整优化过程中学习率,显著推进了深度模型的训练。然而,学习率的 ad-hoc 调参带来实践中的效率问题。为此,近期研究聚焦于开发无需学习率调参的“学习率自由”或“参数自由”算法。尽管如此,现有 AdaGrad 和 Adam 的参数自由变体往往过于复杂且缺乏形式收敛保证。本文提出 AdaGrad++ 和 Adam++,两种 novel 且简单的参数自由变体,并给出收敛性保证。我们证明 AdaGrad++ 在无预定义学习率假设下,达到 AdaGrad 相同的收敛速率。类似地,Adam++ 在无学习率条件约束下,匹配 Adam 的收敛速率。实验结果表明,AdaGrad++ 和 Adam++ 在various 深度学习任务中表现竞争。

关键词

引用

@article{arxiv.2412.19444,
  title  = {Towards Simple and Provable Parameter-Free Adaptive Gradient Methods},
  author = {Yuanzhe Tao and Huizhuo Yuan and Xun Zhou and Yuan Cao and Quanquan Gu},
  journal= {arXiv preprint arXiv:2412.19444},
  year   = {2024}
}

备注

34 pages, 16 figures, 3 tables