中文

面向非凸分散学习的压缩与稀疏模型

机器学习 2024-06-07 v2 分布式、并行与集群计算 数据结构与算法 多智能体系统 最优化与控制

摘要

近期研究强调频繁的模型通信是分散式机器学习(ML)效率的一大瓶颈,尤其对于大规模和过参数化神经网络(NNs)而言。为此,我们提出 Malcom-PSGD,一种结合梯度压缩技术与模型稀疏化的新型分散式 ML 算法。我们通过向目标函数添加 1\ell_1 正则化来促进模型稀疏性,并给出一种用于训练的分散式近端 SGD 方法。我们的方法采用向量信源编码和基于抖动的量化来实现稀疏化模型的压缩梯度通信。我们的分析表明,在恒定共识与学习率假设下,Malcom-PSGD 关于迭代次数 tt 达到 O(1/t)\mathcal{O}(1/\sqrt{t}) 的收敛速率。这一结果由我们针对非凸压缩近端 SGD 方法收敛性的证明所支撑。此外,我们进行了比特分析,给出了与 Malcom-PSGD 相关的通信开销的闭式表达式。数值结果验证了我们的理论发现,并表明与当前最优(SOTA)方法相比,我们的方法将通信成本降低了约 75%75\%

关键词

引用

@article{arxiv.2311.05760,
  title  = {Compressed and Sparse Models for Non-Convex Decentralized Learning},
  author = {Andrew Campbell and Hang Liu and Leah Woldemariam and Anna Scaglione},
  journal= {arXiv preprint arXiv:2311.05760},
  year   = {2024}
}