去掉那个平方根:AdaGrad的一种新的高效尺度不变版本
机器学习
2025-01-15 v4 人工智能
最优化与控制
摘要
自适应方法在机器学习中非常流行,因为它们降低了学习率调优的成本。本文介绍了一种名为KATE的新型优化算法,该算法是著名AdaGrad算法的尺度不变自适应版本。我们证明了KATE在广义线性模型情况下的尺度不变性。此外,对于一般光滑非凸问题,我们建立了KATE的收敛率为,与AdaGrad和Adam已知的最佳收敛率相匹配。我们还在不同问题的数值实验中,包括图像分类和文本分类等复杂机器学习任务,将KATE与其他最先进的自适应算法Adam和AdaGrad进行了比较。结果表明,在所有考虑的场景中,KATE始终优于AdaGrad,并与Adam性能相当或超越。
引用
@article{arxiv.2403.02648,
title = {Remove that Square Root: A New Efficient Scale-Invariant Version of AdaGrad},
author = {Sayantan Choudhury and Nazarii Tupitsa and Nicolas Loizou and Samuel Horvath and Martin Takac and Eduard Gorbunov},
journal= {arXiv preprint arXiv:2403.02648},
year = {2025}
}
备注
32 pages, 12 figures