基于超梯度下降的可证明且实用的在线学习率自适应
最优化与控制
2025-03-18 v2 机器学习
摘要
本文研究了超梯度下降方法(HDM)的收敛性质。HDM 是一种已有 25 年历史的方法,最初被提出用于随机一阶方法中的自适应步长选择。我们利用 [Gao24] 的在线学习框架对 HDM 提供了首次严格的收敛分析,并将该分析应用于开发具有经验与理论支持的新一代自适应梯度方法。值得注意的是,HDM 能自动识别局部优化景观的最优步长,并实现局部超线性收敛。我们的分析解释了文献中报告的 HDM 不稳定性,并提出了高效的策略来应对它。我们还开发了两种带有重球动量和 Nesterov 动量的 HDM 变体。在确定性凸问题上的实验表明,带有重球动量的 HDM(HDM-HB)表现出稳健的性能,并显著优于其他自适应一阶方法。此外,HDM-HB 经常匹配高效实用的拟牛顿方法 L-BFGS 的性能,同时使用更少的内存和更廉价的迭代。
引用
@article{arxiv.2502.11229,
title = {Provable and Practical Online Learning Rate Adaptation with Hypergradient Descent},
author = {Ya-Chi Chu and Wenzhi Gao and Yinyu Ye and Madeleine Udell},
journal= {arXiv preprint arXiv:2502.11229},
year = {2025}
}