中文

机器学习中启发式优化算法的形式化保证

机器学习 2022-08-02 v1 机器学习

摘要

近来,随机梯度下降(SGD)及其变体已成为机器学习(ML)问题大规模优化的主导方法。已提出多种调整步长的策略,从自适应步长到在每次迭代中改变步长的启发式方法。此外,动量已广泛用于 ML 任务以加速训练过程。然而,我们对它们的理论理解存在差距。本工作中,我们开始通过为若干启发式优化方法提供形式化保证并提出改进算法来缩小这一差距。首先,我们分析了凸和非凸设定下 AdaGrad 的广义版本(Delayed AdaGrad)步长,表明这些步长使算法能自动适应随机梯度噪声的水平。我们首次给出了 Delayed AdaGrad 梯度几乎必然收敛到零的充分条件。此外,我们给出了非凸设定下 Delayed AdaGrad 及其动量变体的高概率分析。其次,我们分析了具有指数和余弦步长的 SGD,它们在经验上成功但缺乏理论支持。我们提供了它们在光滑非凸设定下(有和无 Polyak-{\L}ojasiewicz(PL)条件)的首个收敛保证。我们还展示了它们在 PL 条件下对噪声的自适应性良好性质。第三,我们研究动量方法的末次迭代。我们证明了带常动量的 SGD 末次迭代在凸设定下的首个下界。此外,我们研究了一类基于 Follow-The-Regularized-Leader 的动量算法,其具有递增动量和收缩更新。我们展示了它们的末次迭代对无约束凸随机优化问题具有最优收敛性。

关键词

引用

@article{arxiv.2208.00502,
  title  = {Formal guarantees for heuristic optimization algorithms used in machine learning},
  author = {Xiaoyu Li},
  journal= {arXiv preprint arXiv:2208.00502},
  year   = {2022}
}

备注

Ph.D. Thesis