一种基于梯度分解的新自适应梯度方法
机器学习
2021-07-20 v1 最优化与控制
摘要
自适应梯度方法,尤其是 Adam 型方法(如 Adam、AMSGrad 和 AdaBound),已被提出通过在学习率上采用逐元素缩放项来加速训练过程。然而,与随机梯度下降(SGD)及其加速方案(如带动量的 SGD(SGDM))相比,它们往往泛化性能较差。在本文中,我们提出一种称为 DecGD 的新自适应方法,它同时实现了像 SGDM 一样好的泛化能力和像 Adam 型方法一样的快速收敛。特别地,DecGD 将当前梯度分解为包括替代梯度和基于损失的向量的两项之积。我们的方法根据当前的基于损失的向量而非 Adam 型方法中使用的平方梯度来自适应调整学习率。DecGD 自适应学习率的直观思想是,一般情况下,一个好的优化器需要随着损失减小而降低学习率,这类似于学习率衰减调度技术。因此,DecGD 在训练早期阶段快速收敛,并根据基于损失的向量控制有效学习率,从而有助于更好的泛化。我们讨论了凸和非凸情形下的收敛性分析。最后,在广泛使用的数据集和模型上的实证结果表明,DecGD 展现出比 SGDM 更好的泛化性能以及像 Adam 型方法一样的快速收敛。
引用
@article{arxiv.2107.08377,
title = {A New Adaptive Gradient Method with Gradient Decomposition},
author = {Zhou Shao and Tong Lin},
journal= {arXiv preprint arXiv:2107.08377},
year = {2021}
}