中文

关于带偏置梯度的 SGD 的收敛性

机器学习 2021-05-11 v2 最优化与控制 机器学习

摘要

我们分析了偏置随机梯度方法(SGD)的复杂度,其中每次更新都被确定性的、即偏置误差项所破坏。我们推导了光滑(非凸)函数的收敛结果,并在 Polyak-Lojasiewicz 条件下给出了改进速率。我们量化了偏置的大小如何影响可达精度与收敛速率(有时导致发散)。我们的框架涵盖了诸多应用,其中出于性能原因,仅有偏置梯度更新可用或优于无偏更新。例如,在分布式学习领域,偏置梯度压缩技术如 top-k 压缩已被提出作为缓解通信瓶颈的工具;在零阶优化中,只能查询偏置梯度估计器。我们讨论了若干指导性示例以展示我们分析广泛的适用性。

关键词

引用

@article{arxiv.2008.00051,
  title  = {On the Convergence of SGD with Biased Gradients},
  author = {Ahmad Ajalloeian and Sebastian U. Stich},
  journal= {arXiv preprint arXiv:2008.00051},
  year   = {2021}
}

备注

Accepted to ICML 2020 Workshop "Beyond First Order Methods in ML Systems", updated 2021