中文

异质数据下带一位压缩器的分布式非凸优化:高效且具弹性的算法

机器学习 2023-02-21 v2 密码学与安全 分布式、并行与集群计算 机器学习

摘要

联邦学习(FL)是一种新兴的分散式学习框架,在此框架下大量异构客户端协作训练模型而不泄露其本地数据。通信稀缺、隐私泄露与拜占庭攻击是系统可扩展性的关键瓶颈。本文关注驱动 FL 的通信高效分布式(随机)梯度下降用于非凸优化。我们提出两种算法,称为自适应随机符号 SGD(Ada-StoSign)与 β\beta-随机符号 SGD(β\beta-StoSign),各自将本地梯度压缩为比特向量。为处理无界梯度,Ada-StoSign 使用一种新颖的范数跟踪函数,自适应调整对本地梯度 \ell_{\infty} 的粗粒度估计——这是梯度压缩中使用的关键参数。我们证明 Ada-StoSign 以期望收敛,速率为 O(logT/T+1/M)O(\log T/\sqrt{T} + 1/\sqrt{M}),其中 MM 为客户端数量。据我们所知,当 MM 足够大时,Ada-StoSign 优于收敛速率为 O(T1/4)O(T^{-1/4}) 的当前最优基于符号的方法。在梯度有界假设下,β\beta-StoSign 实现了可量化的拜占庭弹性与隐私保证,并适用于部分客户端参与及可能无界的 mini-batch 梯度。我们在 MNIST 与 CIFAR-10 数据集上通过实验证实并补充了我们的理论。

关键词

引用

@article{arxiv.2210.00665,
  title  = {Distributed Non-Convex Optimization with One-Bit Compressors on Heterogeneous Data: Efficient and Resilient Algorithms},
  author = {Ming Xiang and Lili Su},
  journal= {arXiv preprint arXiv:2210.00665},
  year   = {2023}
}