稀疏 LoCo 用于高效 LLM 预训练
机器学习
2025-11-07 v2
摘要
通信效率分布式训练算法近年来受到广泛关注,因为其在带宽受限环境(如跨数据中心或通过互联网)下有助于训练大型语言模型 (LLM)。尽管减少了通信频率,这些方法仍通常需要传输完整的模型梯度副本,这在跨数据中心链接上仍会成为通信瓶颈。此外,它们与简单的 AdamW DDP 基线相比会略微降低性能。尽管量化常用于减小伪梯度的大小,但在 LLM 预训练中,现有方法无法充分利用稀疏化,且量化效果有限。本文引入 SparseLoCo,这是一种用于 LLM 的通信效率训练算法,有效利用误差反馈结合 Top-k 稀疏化和 2 位量化,以实现 1-3% 的极端稀疏度,同时超越全精度 DiLoCo。我们的关键观察是,外部动量可通过误差反馈累加器结合激进稀疏化来局部近似,稀疏聚合实际上可以改善模型性能。我们在各种通信受限的 LLM 训练设置下进行实证验证,表明 SparseLoCo 在性能和通信成本方面均提供了显著优势。
引用
@article{arxiv.2508.15706,
title = {Communication Efficient LLM Pre-training with SparseLoCo},
author = {Amir Sarfi and Benjamin Thérien and Joel Lidin and Eugene Belilovsky},
journal= {arXiv preprint arXiv:2508.15706},
year = {2025}
}
备注
20 pages, 14 tables, 2 figures