中文

用于梯度压缩的收缩误差反馈

机器学习 2023-12-15 v1 人工智能

摘要

由于(i)多 GPU 训练中模型规模的增大,以及(ii)深度神经网络在存储有限的物联网设备上联邦学习的广泛采用,分布式深度学习中的设备端内存问题变得日益严重。在这些场景下,通信高效的优化方法是极具吸引力的替代方案,但它们仍然面临内存问题。为了应对这些挑战,我们提出了一种名为收缩误差反馈(ConEF)的通信高效方法。与内存管理低效的带误差反馈的 SGD(EFSGD)不同,ConEF 获得了收敛与内存使用之间的最佳平衡,并通过利用有偏且可全规约的梯度压缩实现了通信高效。我们在包括图像分类、语言建模和机器翻译在内的各种学习任务上对 ConEF 进行了实证验证,观察到 ConEF 节省了 EFSGD 中 80% - 90% 的额外内存,且测试性能几乎没有损失,同时还实现了 1.3 倍至 5 倍的 SGD 加速。通过我们的工作,我们还证明了 ConEF 的可行性和收敛性,从而清除了将 ConEF 集成到诸如 ZeRO-3 等流行内存高效框架中的理论障碍。

关键词

引用

@article{arxiv.2312.08538,
  title  = {Contractive error feedback for gradient compression},
  author = {Bingcong Li and Shuai Zheng and Parameswaran Raman and Anshumali Shrivastava and Georgios B. Giannakis},
  journal= {arXiv preprint arXiv:2312.08538},
  year   = {2023}
}