1-bit Adam:兼具 Adam 收敛速度的高效通信大规模训练
机器学习
2021-07-01 v2 分布式、并行与集群计算
摘要
大规模模型(如 BERT 和 GPT-3)的可扩展训练需要根植于模型设计、架构和系统能力的精心优化。从系统角度看,通信已成为主要瓶颈,尤其是在提供有限网络带宽、配备标准 TCP 互联的商用系统上。通信压缩是在此类系统上减少训练时间的重要技术。最有效的方法之一是误差补偿压缩,其即使在 1-bit 压缩下也能提供稳健的收敛速度。然而,最先进的误差补偿技术仅适用于 SGD 和动量 SGD 等基础优化器,它们对梯度线性依赖。它们不适用于 Adam 等基于梯度的非线性优化器,而后者为 BERT 等模型提供了最先进的收敛效率和精度。本文中,我们提出 1-bit Adam,将通信量最多降低 5×,提供更好的可扩展性,并给出与未压缩 Adam 相同的收敛速度。我们的关键发现是,Adam 的方差(非线性项)在(预热阶段后)变得稳定,并可在其余训练(压缩阶段)中用作固定预条件。在最多 256 块 GPU 上的实验表明,1-bit Adam 使 BERT-Large 预训练吞吐量最高提升 3.3×,SQuAD 微调吞吐量最高提升 2.9×。此外,我们为所提工作提供了理论分析。
引用
@article{arxiv.2102.02888,
title = {1-bit Adam: Communication Efficient Large-Scale Training with Adam's Convergence Speed},
author = {Hanlin Tang and Shaoduo Gan and Ammar Ahmad Awan and Samyam Rajbhandari and Conglong Li and Xiangru Lian and Ji Liu and Ce Zhang and Yuxiong He},
journal= {arXiv preprint arXiv:2102.02888},
year = {2021}
}
备注
arXiv admin note: text overlap with arXiv:2008.11343