中文

关于 SARAH 及其扩展算法的收敛性

机器学习 2020-01-17 v2 最优化与控制 机器学习

摘要

本工作的主题是针对表述为 nn 个独立损失函数之和的问题的一个统一算法,即无循环 SARAH(L2S)。L2S 拓宽了最近开发的称为 SARAH 的方差缩减方法。为求得 ϵ\epsilon-精确解,L2S 在强凸问题上具有 O((n+κ)ln(1/ϵ)){\cal O}\big( (n+\kappa) \ln (1/\epsilon)\big) 的复杂度。对于凸问题,当采用依赖于 nn 的步长时,L2S 的复杂度为 O(n+n/ϵ){\cal O}(n+ \sqrt{n}/\epsilon);而对于更常采用的与 nn 无关的步长,复杂度为 O(n+n/ϵ){\cal O}(n+ n/\epsilon)。与 SARAH 不同,我们的理论发现支持在凸问题中采用与 nn 无关的步长而无需额外假设。对于非凸问题,L2S 的复杂度为 O(n+n/ϵ){\cal O}(n+ \sqrt{n}/\epsilon)。我们在神经网络上的数值测试表明,L2S 可以比 SARAH 具有更好的泛化性质。除 L2S 外,我们的侧面结果包括 SARAH 在强凸问题中最后一次迭代的线性收敛。

关键词

引用

@article{arxiv.1906.02351,
  title  = {On the Convergence of SARAH and Beyond},
  author = {Bingcong Li and Meng Ma and Georgios B. Giannakis},
  journal= {arXiv preprint arXiv:1906.02351},
  year   = {2020}
}