中文

加速分布式优化:关于局部步骤的 primal-dual 视角

机器学习 2024-08-13 v2 分布式、并行与集群计算 最优化与控制 机器学习

摘要

在分布式机器学习中,跨多个数据分布不同的代理机构进行高效训练面临着重大挑战。即便存在集中式协调器,当前实现最优通信复杂度的算法通常需要大批量或牺牲梯度复杂度。本文在强凸、凸和非凸目标下,针对集中式和去中心化设置进行了研究。我们首先表明,一种基本的 primal-dual 方法——(加速)梯度上升多重随机梯度下降(GA-MSGD)应用于分布式优化的拉格朗日函数,本质上包含局部更新,因为对原始变量执行随机梯度下降的内循环无需代理间通信。值得注意的是,对于强凸目标,(加速)GA-MSGD尽管拉格朗日函数仅在对偶变量上线性,却在通信轮次中实现线性收敛。这源于对偶变量受限于耦合矩阵的张量空间,从而使对偶问题强凹。当与Catalyst框架集成时,我们的方法在各种设置下实现接近最优的通信复杂度,而无需批量。

关键词

引用

@article{arxiv.2407.02689,
  title  = {Accelerating Distributed Optimization: A Primal-Dual Perspective on Local Steps},
  author = {Junchi Yang and Murat Yildirim and Qiu Feng},
  journal= {arXiv preprint arXiv:2407.02689},
  year   = {2024}
}