一种从 Adam 到 SGD 的递减缩放过渡方案
机器学习
2021-09-14 v2
摘要
自适应梯度算法(AdaGrad)及其变体,如 RMSProp、Adam、AMSGrad 等,已在深度学习中得到广泛应用。尽管这些算法在训练早期速度较快,但其泛化性能往往不如随机梯度下降(SGD)。因此,在若干迭代后将 Adam 转换为 SGD 以兼顾两种算法优点的折中方法,在理论与实践中均具有重要意义。为此,我们提出一种递减缩放过渡方案,以实现从 Adam 到 SGD 的平滑稳定过渡,称为 DSTAdam。所提出的 DSTAdam 的收敛性亦在在线凸设定下得到证明。最后,在 CIFAR-10/100 数据集上验证了 DSTAdam 的有效性。我们的实现可在 https://github.com/kunzeng/DSTAdam 获取。
引用
@article{arxiv.2106.06749,
title = {A decreasing scaling transition scheme from Adam to SGD},
author = {Kun Zeng and Jinlan Liu and Zhixia Jiang and Dongpo Xu},
journal= {arXiv preprint arXiv:2106.06749},
year = {2021}
}