中文

方差缩减的 EXTRA 与 DIGing 及其在强凸分散优化中的最优加速

最优化与控制 2022-08-30 v3 分布式、并行与集群计算 机器学习 数值分析 数值分析

摘要

我们研究用于大规模分布式数据机器学习模型训练的随机分散优化。我们将广泛使用的 EXTRA 与 DIGing 方法扩展以纳入方差缩减(VR),并提出两种方法:VR-EXTRA 与 VR-DIGing。所提 VR-EXTRA 需要 O((κs+n)log1ϵ)O((\kappa_s+n)\log\frac{1}{\epsilon}) 次随机梯度评估与 O((κb+κc)log1ϵ)O((\kappa_b+\kappa_c)\log\frac{1}{\epsilon}) 轮通信以达到精度 ϵ\epsilon,这是非加速梯度类方法中的最优复杂度,其中 κs\kappa_sκb\kappa_b 分别为强凸光滑问题的随机条件数与批量条件数,κc\kappa_c 为通信网络条件数,nn 为各分布式节点上的样本量。所提 VR-DIGing 的通信代价略高,为 O((κb+κc2)log1ϵ)O((\kappa_b+\kappa_c^2)\log\frac{1}{\epsilon})。我们的随机梯度计算复杂度与单机 VR 方法(如 SAG、SAGA、SVRG)相同,而通信复杂度分别保持与 EXTRA 和 DIGing 一致。为进一步加速收敛,我们还提出了加速 VR-EXTRA 与 VR-DIGing,具有最优的 O((nκs+n)log1ϵ)O((\sqrt{n\kappa_s}+n)\log\frac{1}{\epsilon}) 随机梯度计算复杂度与 O(κbκclog1ϵ)O(\sqrt{\kappa_b\kappa_c}\log\frac{1}{\epsilon}) 通信复杂度。我们的随机梯度计算复杂度也与单机加速 VR 方法(如 Katyusha)相同,而通信复杂度保持与加速全批量分散方法(如 MSDA)一致。

关键词

引用

@article{arxiv.2009.04373,
  title  = {Variance Reduced EXTRA and DIGing and Their Optimal Acceleration for Strongly Convex Decentralized Optimization},
  author = {Huan Li and Zhouchen Lin and Yongchun Fang},
  journal= {arXiv preprint arXiv:2009.04373},
  year   = {2022}
}