SPARQ-SGD:去中心化随机优化中的事件触发与压缩通信
机器学习
2020-02-26 v2 分布式、并行与集群计算
机器学习
最优化与控制
摘要
在本文中,我们提出并分析了 SPARQ-SGD,这是一种用于大规模机器学习模型去中心化训练的事件触发与压缩算法。每个节点可以在本地计算一个条件(事件),该条件触发一次通信,发送量化并稀疏化的本地模型参数。在 SPARQ-SGD 中,每个节点至少执行固定步数()的本地梯度步,然后检查模型参数相较于其上一次更新是否发生显著变化;仅当存在由(设计)准则指定的显著变化时,才进一步通信压缩后的模型参数。我们证明了 SPARQ-SGD 在强凸和非凸设定下分别以 和 的速率收敛,表明这种激进的压缩(包括事件触发通信、模型稀疏化与量化)相较于未压缩的去中心化训练并不影响整体收敛速率;从而在理论上“免费”获得了通信效率。我们在真实数据集上评估了 SPARQ-SGD,以展示相较于最先进方法在通信上的显著节省。
引用
@article{arxiv.1910.14280,
title = {SPARQ-SGD: Event-Triggered and Compressed Communication in Decentralized Stochastic Optimization},
author = {Navjot Singh and Deepesh Data and Jemin George and Suhas Diggavi},
journal= {arXiv preprint arXiv:1910.14280},
year = {2020}
}
备注
41 pages, 4 figures