DoWG释放潜力:一种高效的通用无参数梯度下降方法
机器学习
2024-01-31 v4 最优化与控制
机器学习
摘要
本文提出一种易于实现的基于梯度的无参数优化器:DoWG(Distance over Weighted Gradients,基于距离加权梯度的归一化)。我们证明 DoWG 是高效的——在凸优化中与最优调参的梯度下降收敛速率仅相差对数因子且无需调参,并且是通用的——自动适应光滑与非光滑问题。遵循 AdaGrad 框架的流行算法计算平方梯度的滑动平均用于归一化,而 DoWG 维护一种基于距离加权的滑动平均新形式,这是实现所需性质的关键。为补充我们的理论,我们还通过实验表明 DoWG 在稳定性边缘训练,并在实际机器学习任务上验证其有效性。
引用
@article{arxiv.2305.16284,
title = {DoWG Unleashed: An Efficient Universal Parameter-Free Gradient Descent Method},
author = {Ahmed Khaled and Konstantin Mishchenko and Chi Jin},
journal= {arXiv preprint arXiv:2305.16284},
year = {2024}
}
备注
22 pages, 1 table, 4 figures