中文

一种从 Adam 到 SGD 的递减缩放过渡方案

机器学习 2021-09-14 v2

摘要

自适应梯度算法(AdaGrad)及其变体,如 RMSProp、Adam、AMSGrad 等,已在深度学习中得到广泛应用。尽管这些算法在训练早期速度较快,但其泛化性能往往不如随机梯度下降(SGD)。因此,在若干迭代后将 Adam 转换为 SGD 以兼顾两种算法优点的折中方法,在理论与实践中均具有重要意义。为此,我们提出一种递减缩放过渡方案,以实现从 Adam 到 SGD 的平滑稳定过渡,称为 DSTAdam。所提出的 DSTAdam 的收敛性亦在在线凸设定下得到证明。最后,在 CIFAR-10/100 数据集上验证了 DSTAdam 的有效性。我们的实现可在 https://github.com/kunzeng/DSTAdam 获取。

关键词

引用

@article{arxiv.2106.06749,
  title  = {A decreasing scaling transition scheme from Adam to SGD},
  author = {Kun Zeng and Jinlan Liu and Zhixia Jiang and Dongpo Xu},
  journal= {arXiv preprint arXiv:2106.06749},
  year   = {2021}
}