中文

基于梯度追踪的分布式优化再探:通过代理化提升收敛速率

最优化与控制 2020-10-13 v2 分布式、并行与集群计算

摘要

我们研究(有向、时变)图上的分布式多智能体优化。我们考虑在凸约束下最小化 F+GF+G,其中 FF 是各智能体损失的平滑强凸和,GG 是一个非平滑凸函数。我们建立在 SONATA 算法之上:该算法在智能体的子问题中采用代理目标函数(从而超越了线性化,如近端梯度),并结合一种扰动(push-sum)共识机制,旨在局部追踪 FF 的梯度。SONATA 在每个节点上以 O(κglog(1/ϵ))\mathcal{O}(\kappa_g \log(1/\epsilon)) 次梯度计算以及 O~(κg(1ρ)1/2log(1/ϵ))\tilde{\mathcal{O}}\big(\kappa_g (1-\rho)^{-1/2} \log(1/\epsilon)\big) 次通信步达到目标值精度 ϵ>0\epsilon>0,其中 κg\kappa_gFF 的条件数,ρ\rho 刻画网络的连通性。这是分布式复合优化的首个线性速率结果;它也改进了现有的仅最小化 FF 的(非加速)方案,其后者的速率依赖于远大于 κg\kappa_g 的量(例如各智能体间的最坏条件数)。当特别考虑具有统计相似数据的经验风险最小化问题时,采用高阶代理的 SONATA 在 O((β/μ)log(1/ϵ))\mathcal{O}\big((\beta/\mu) \log(1/\epsilon)\big) 次迭代和 O~((β/μ)(1ρ)1/2log(1/ϵ))\tilde{\mathcal{O}}\big((\beta/\mu) (1-\rho)^{-1/2} \log(1/\epsilon)\big) 次通信步内达到精度 ϵ>0\epsilon>0,其中 β\beta 度量各智能体损失的相似程度,μ\muFF 的强凸常数。因此,当 β/μ<κg\beta/\mu < \kappa_g 时,使用高阶代理可证明地比一阶模型所能达到的速率更快;且这无需在网络中交换任何 Hessian 矩阵。

关键词

引用

@article{arxiv.1905.02637,
  title  = {Distributed Optimization Based on Gradient-tracking Revisited: Enhancing Convergence Rate via Surrogation},
  author = {Ying Sun and Amir Daneshmand and Gesualdo Scutari},
  journal= {arXiv preprint arXiv:1905.02637},
  year   = {2020}
}

备注

This revised version contains explicit expression of the convergence rates. Furthermore, new rates are provided in the case data among the agents are statistically similar