中文

基于稀疏化梯度差的分布式学习

机器学习 2022-02-08 v1 人工智能

摘要

解决分布式学习任务通常需要大量的通信次数,这在无线通信应用中严重限制了可扩展性和收敛速度。本文设计了一种带稀疏化与误差纠正的梯度下降方法(GD-SEC),以提升通用 worker-server 架构下的通信效率。受多种无线通信学习场景的启发,GD-SEC 在不降低收敛速率量级的前提下,减少了 worker 到 server 每次通信的比特数。这使得大规模模型学习得以在不牺牲收敛性或精度的条件下进行。在 GD-SEC 的每次迭代中,每个 worker 不直接传输整个梯度向量,而是计算其当前梯度与先前已传输梯度的线性组合之差,然后将稀疏化后的梯度差传输给 server。GD-SEC 的一个关键特征是:若梯度差向量中任一给定分量的幅值不够大,则不予传输。每个 worker 采用误差纠正技术来补偿由稀疏化引起的误差。我们证明,对于强凸、凸和非凸优化问题,GD-SEC 均能保证收敛,且收敛速率量级与 GD 相同。此外,若目标函数为强凸,GD-SEC 具有快速的线性收敛速率。数值结果不仅验证了 GD-SEC 的收敛速率,还考察了其所提供的通信比特节省。在给定目标精度下,与现有最优算法相比,GD-SEC 能显著减少通信负载而不拖慢优化过程。

关键词

引用

@article{arxiv.2202.02491,
  title  = {Distributed Learning With Sparsified Gradient Differences},
  author = {Yicheng Chen and Rick S. Blum and Martin Takac and Brian M. Sadler},
  journal= {arXiv preprint arXiv:2202.02491},
  year   = {2022}
}