中文

从动量随机梯度下降到普通随机梯度下降的缩放过渡

机器学习 2021-06-15 v1

摘要

普通随机梯度下降与动量随机梯度下降因其简单的设定和低计算复杂度而在深度学习中应用极广。动量随机梯度下降利用累积梯度作为当前参数的更新方向,具有较快的训练速度。由于普通随机梯度下降的方向未经累积梯度修正,对于当前需要更新的参数而言,它是最优方向,其更新更为准确。我们结合动量随机梯度下降训练速度快与普通随机梯度下降精度高的优点,提出一种从动量随机梯度下降到普通随机梯度下降的缩放过渡(TSGD)方法。同时,采用随迭代次数线性衰减的学习率替代恒定学习率。TSGD 算法在早期具有较大步长以加速训练,而在后期以较小步长训练可稳定收敛。实验结果表明,TSGD 算法具有更快的训练速度、更高的准确率和更好的稳定性。我们的实现可在 https://github.com/kunzeng/TSGD 获取。

关键词

引用

@article{arxiv.2106.06753,
  title  = {Scaling transition from momentum stochastic gradient descent to plain stochastic gradient descent},
  author = {Kun Zeng and Jinlan Liu and Zhixia Jiang and Dongpo Xu},
  journal= {arXiv preprint arXiv:2106.06753},
  year   = {2021}
}

备注

16 pages, 18 figures