中文

时间延迟动量:从正则化视角看深度学习随机动量的收敛与泛化

机器学习 2019-06-04 v2 计算机视觉与模式识别 机器学习

摘要

在本文中,我们从正则化的视角研究深度学习随机动量的收敛性与泛化误差界问题。为此,我们首先将动量解释为求解一个 2\ell_2 正则化极小化问题,以学习任意两个连续模型参数之间的偏移量。我们称之为{\em 时间延迟动量},因为模型参数是在迭代若干步寻找极小化器之后才更新的。随后我们提出我们的学习算法,即带有时间延迟动量的随机梯度下降(SGD)。我们表明该算法可解释为使用 SGD 求解一系列强凸优化问题。我们证明在温和条件下,我们的算法能以 O(1K)O(\frac{1}{\sqrt{K}}) 的速率收敛到驻点,并以至少 1δ1-\delta 的概率获得 O(1nδ)O(\frac{1}{\sqrt{n\delta}}) 的泛化误差界,其中 K,nK,n 分别为模型更新次数和训练样本数。我们展示了在深度学习中与最先进的深度学习求解器相比,我们算法的经验优越性。

关键词

引用

@article{arxiv.1903.00760,
  title  = {Time-Delay Momentum: A Regularization Perspective on the Convergence and Generalization of Stochastic Momentum for Deep Learning},
  author = {Ziming Zhang and Wenju Xu and Alan Sullivan},
  journal= {arXiv preprint arXiv:1903.00760},
  year   = {2019}
}

备注

has errors