中文

基于有保证的激活压缩在慢速网络上微调语言模型

机器学习 2023-03-08 v3 分布式、并行与集群计算

摘要

通信压缩是现代分布式学习系统缓解慢速网络通信瓶颈的关键技术。尽管近期对数据并行式训练中的梯度压缩进行了深入研究,对采用流水线并行训练的模型压缩激活仍是一个开放问题。本文中,我们提出AC-SGD,一种面向慢速网络上通信高效流水线并行训练的新型激活压缩算法。与以往激活压缩工作不同,AC-SGD不直接压缩激活值,而是压缩激活的变化量。据我们所知,这首次使得我们可以证明:在激活压缩下,对于非凸目标仍能实现O(1/T)O(1/\sqrt{T})收敛速率,且无需对梯度无偏性做假设——该假设对具有非线性激活函数的深度学习模型并不成立。我们进一步表明,AC-SGD可被高效优化与实现,且不带来额外的端到端运行开销。我们评估了AC-SGD在参数量达15亿的语言模型微调任务中将激活压缩至2-4位的表现。AC-SGD在慢速网络上实现了高达4.3倍的端到端加速,且不损失模型质量。此外,我们还展示了AC-SGD可与最先进的梯度压缩算法结合,实现“端到端通信压缩”:机器间所有通信(包括模型梯度、前向激活与反向梯度)均被压缩为更低精度。这带来了高达4.9倍的端到端加速,且不损失模型质量。

关键词

引用

@article{arxiv.2206.01299,
  title  = {Fine-tuning Language Models over Slow Networks using Activation Compression with Guarantees},
  author = {Jue Wang and Binhang Yuan and Luka Rimanic and Yongjun He and Tri Dao and Beidi Chen and Christopher Re and Ce Zhang},
  journal= {arXiv preprint arXiv:2206.01299},
  year   = {2023}
}