关于动量法末次迭代的收敛性
机器学习
2022-07-26 v3 最优化与控制
机器学习
摘要
带动量的 SGD(SGDM)是一类广泛用于机器学习问题大规模优化的算法。然而,在优化一般凸函数时,任何 SGDM 算法相对于普通 SGD 都无已知优势。此外,即便是最新结果也需要对 SGDM 算法进行修改,如迭代平均和到有限域的投影,而这些在实践中很少使用。在本文中,我们关注 SGDM 末次迭代的收敛速率。我们首次证明,对于任意常数动量因子,存在一个 Lipschitz 且凸的函数,使得 SGDM 的末次迭代在 次迭代后遭受 的次优收敛速率。基于此事实,我们研究一类具有递增动量和收缩更新的(自适应与非自适应)基于 Follow-The-Regularized-Leader 的 SGDM 算法。对于这些算法,我们证明末次迭代在无约束凸随机优化问题中具有最优收敛 ,且无需到有限域的投影也无需知道 。进一步,我们展示了基于 FTRL 的 SGDM 在使用自适应步长时的多种结果。实验结果的展示也包括在内。
引用
@article{arxiv.2102.07002,
title = {On the Last Iterate Convergence of Momentum Methods},
author = {Xiaoyu Li and Mingrui Liu and Francesco Orabona},
journal= {arXiv preprint arXiv:2102.07002},
year = {2022}
}
备注
Differences with ALT'22 camera ready: Clarified the statement of the lower bound