关于带偏置梯度的 SGD 的收敛性
机器学习
2021-05-11 v2 最优化与控制
机器学习
摘要
我们分析了偏置随机梯度方法(SGD)的复杂度,其中每次更新都被确定性的、即偏置误差项所破坏。我们推导了光滑(非凸)函数的收敛结果,并在 Polyak-Lojasiewicz 条件下给出了改进速率。我们量化了偏置的大小如何影响可达精度与收敛速率(有时导致发散)。我们的框架涵盖了诸多应用,其中出于性能原因,仅有偏置梯度更新可用或优于无偏更新。例如,在分布式学习领域,偏置梯度压缩技术如 top-k 压缩已被提出作为缓解通信瓶颈的工具;在零阶优化中,只能查询偏置梯度估计器。我们讨论了若干指导性示例以展示我们分析广泛的适用性。
引用
@article{arxiv.2008.00051,
title = {On the Convergence of SGD with Biased Gradients},
author = {Ahmad Ajalloeian and Sebastian U. Stich},
journal= {arXiv preprint arXiv:2008.00051},
year = {2021}
}
备注
Accepted to ICML 2020 Workshop "Beyond First Order Methods in ML Systems", updated 2021