中文

关于动量法末次迭代的收敛性

机器学习 2022-07-26 v3 最优化与控制 机器学习

摘要

带动量的 SGD(SGDM)是一类广泛用于机器学习问题大规模优化的算法。然而,在优化一般凸函数时,任何 SGDM 算法相对于普通 SGD 都无已知优势。此外,即便是最新结果也需要对 SGDM 算法进行修改,如迭代平均和到有限域的投影,而这些在实践中很少使用。在本文中,我们关注 SGDM 末次迭代的收敛速率。我们首次证明,对于任意常数动量因子,存在一个 Lipschitz 且凸的函数,使得 SGDM 的末次迭代在 TT 次迭代后遭受 Ω(lnTT)\Omega(\frac{\ln T}{\sqrt{T}}) 的次优收敛速率。基于此事实,我们研究一类具有递增动量和收缩更新的(自适应与非自适应)基于 Follow-The-Regularized-Leader 的 SGDM 算法。对于这些算法,我们证明末次迭代在无约束凸随机优化问题中具有最优收敛 O(1T)O(\frac{1}{\sqrt{T}}),且无需到有限域的投影也无需知道 TT。进一步,我们展示了基于 FTRL 的 SGDM 在使用自适应步长时的多种结果。实验结果的展示也包括在内。

关键词

引用

@article{arxiv.2102.07002,
  title  = {On the Last Iterate Convergence of Momentum Methods},
  author = {Xiaoyu Li and Mingrui Liu and Francesco Orabona},
  journal= {arXiv preprint arXiv:2102.07002},
  year   = {2022}
}

备注

Differences with ALT'22 camera ready: Clarified the statement of the lower bound