中文

有损梯度压缩:一比特能换来多少精度?

机器学习 2022-06-06 v2 信息论 math.IT

摘要

在联邦学习(FL)中,全局模型由参数服务器(PS)通过聚合多个远程学习器得到的模型更新进行训练。通常,远程用户与 PS 之间的通信受速率限制,而 PS 到远程用户的传输不受约束。FL 设定引出了一种分布式学习场景,其中远程学习器的更新必须被压缩,以满足上行传输至 PS 的通信速率约束。针对该问题,人们希望压缩模型更新,以最小化由压缩误差导致的精度损失。本文采用率失真方法解决深度神经网络(DNNs)分布式训练的压缩器设计问题。具体而言,我们定义在通信速率约束下的压缩性能度量——\emph{每比特精度}——其刻画了每比特通信为集中式模型带来的最终精度提升。为最大化每比特精度,我们考虑将远程学习器处的 DNN 梯度更新建模为广义正态分布。在此 DNN 梯度分布假设下,我们提出一类失真度量以辅助模型更新压缩的量化器设计。我们认为该失真度量族(我们称之为“M-幅值加权 L2L_2”范数)抓住了实践者在梯度压缩器选择上的直觉。文中给出了针对 CIFAR-10 数据集的数值仿真以验证所提方法。

关键词

引用

@article{arxiv.2202.02812,
  title  = {Lossy Gradient Compression: How Much Accuracy Can One Bit Buy?},
  author = {Sadaf Salehkalaibar and Stefano Rini},
  journal= {arXiv preprint arXiv:2202.02812},
  year   = {2022}
}