中文

ZeroSARAH:无需全梯度计算的高效非凸有限和优

机器学习 2021-10-12 v3 分布式、并行与集群计算 最优化与控制

摘要

我们提出 ZeroSARAH——方差缩减方法 SARAH(Nguyen 等人,2017)的新变体——用于最小化大量非凸函数的平均值 1ni=1nfi(x)\frac{1}{n}\sum_{i=1}^{n}f_i(x)。据我们所知,在此非凸有限和情形下,所有现有方差缩减方法(包括 SARAH、SVRG、SAGA 及其变体)均需在初始点 x0x^0 计算所有 nn 个数据样本上的全梯度,然后每隔若干迭代周期计算一次全梯度(对于 SVRG、SARAH 及其变体)。注意 SVRG、SAGA 及其变体通常取得比 SARAH 变体更弱的收敛结果:n2/3/ϵ2n^{2/3}/\epsilon^2 对比 n1/2/ϵ2n^{1/2}/\epsilon^2。因此我们聚焦于 SARAH 的变体。所提出的 ZeroSARAH 及其分布式变体 D-ZeroSARAH 是\emph{首个}不需要任何全梯度计算(甚至初始点也不需要)的方差缩减算法。此外,在标准与分布式设定下,我们均展示 ZeroSARAH 与 D-ZeroSARAH 取得了新的最优收敛结果,在某些情形下可改进先前已知最佳结果(如由 SPIDER、SARAH 与 PAGE 给出)。避免任何全梯度计算(耗时步骤)在许多应用中十分重要,因为数据样本数 nn 通常非常大。尤其在分布式设定中,对所有数据样本周期计算全梯度需周期同步所有客户端/设备/机器,这可能不可行或难以承受。因此我们预期 ZeroSARAH/D-ZeroSARAH 将在全设备参与不现实的分布式与联邦学习中产生实际影响。

关键词

引用

@article{arxiv.2103.01447,
  title  = {ZeroSARAH: Efficient Nonconvex Finite-Sum Optimization with Zero Full Gradient Computation},
  author = {Zhize Li and Slavomír Hanzely and Peter Richtárik},
  journal= {arXiv preprint arXiv:2103.01447},
  year   = {2021}
}

备注

28 pages