异质数据下带一位压缩器的分布式非凸优化:高效且具弹性的算法
机器学习
2023-02-21 v2 密码学与安全
分布式、并行与集群计算
机器学习
摘要
联邦学习(FL)是一种新兴的分散式学习框架,在此框架下大量异构客户端协作训练模型而不泄露其本地数据。通信稀缺、隐私泄露与拜占庭攻击是系统可扩展性的关键瓶颈。本文关注驱动 FL 的通信高效分布式(随机)梯度下降用于非凸优化。我们提出两种算法,称为自适应随机符号 SGD(Ada-StoSign)与 -随机符号 SGD(-StoSign),各自将本地梯度压缩为比特向量。为处理无界梯度,Ada-StoSign 使用一种新颖的范数跟踪函数,自适应调整对本地梯度 的粗粒度估计——这是梯度压缩中使用的关键参数。我们证明 Ada-StoSign 以期望收敛,速率为 ,其中 为客户端数量。据我们所知,当 足够大时,Ada-StoSign 优于收敛速率为 的当前最优基于符号的方法。在梯度有界假设下,-StoSign 实现了可量化的拜占庭弹性与隐私保证,并适用于部分客户端参与及可能无界的 mini-batch 梯度。我们在 MNIST 与 CIFAR-10 数据集上通过实验证实并补充了我们的理论。
引用
@article{arxiv.2210.00665,
title = {Distributed Non-Convex Optimization with One-Bit Compressors on Heterogeneous Data: Efficient and Resilient Algorithms},
author = {Ming Xiang and Lili Su},
journal= {arXiv preprint arXiv:2210.00665},
year = {2023}
}