中文

随机非凸优化中步长在线学习的替代损失

机器学习 2019-06-10 v2 最优化与控制 机器学习

摘要

随机梯度下降(SGD)在机器学习中发挥了核心作用。然而,它需要精心手工选取步长以实现快速收敛,而调参 notoriously 繁琐且耗时。在过去几年中,大量自适应基于梯度的算法涌现以缓解此问题。它们在实践中被证明能减少调参负担,但其中许多即使在凸设定下也缺乏理论保证。在本文中,我们提出新的替代损失,将非凸光滑目标函数随机优化的最优步长学习问题转化为在线凸优化问题。这允许使用无遗憾(no-regret)在线算法即时计算最优步长。进而,这产生了一种具有自调节步长的 SGD 算法,其保证的收敛速率自动适应噪声水平。

关键词

引用

@article{arxiv.1901.09068,
  title  = {Surrogate Losses for Online Learning of Stepsizes in Stochastic Non-Convex Optimization},
  author = {Zhenxun Zhuang and Ashok Cutkosky and Francesco Orabona},
  journal= {arXiv preprint arXiv:1901.09068},
  year   = {2019}
}