中文

NoLoCo: 无 all-reduce 低通信训练方法用于大模型

机器学习 2025-06-13 v1

摘要

大型语言模型的训练通常通过在包含数万个加速器的集群上进行优化来完成,通过高带宽互连进行通信。扩大集群规模昂贵且可能变得不可行,限制了可以训练的模型规模。最近的几项研究提出了需要通信更少的训练方法,避免需要高度互联的计算集群。这些最先进的低通信训练方法仍然采用模型参数的同步步骤,这一步骤在所有模型副本之间执行时,在低带宽网络上可能变得昂贵。本文提出一种新型优化方法 NoLoCo,不会在训练期间显式同步所有模型参数,因此不需要任何集体通信。NoLoCo 通过对 Nesterov 动量优化器的一种新变体进行部分平均来隐式同步模型权重。我们提供了该优化器的理论收敛分析以及来自语言模型训练的实证结果。我们在广泛的加速器数量和模型规模范围内对 NoLoCo 进行基准测试,规模从 1.25 亿参数到 68 亿参数不等。我们的方法在完全分片数据并行训练或即使是广泛使用的低通信训练方法 DiLoCo 方面的通信开销显著低于前者。对于 few hundred 加速器通过互联网训练的同步步骤,估计速度比 DiLoCo 中使用的 all-reduce 快一个数量级。我们也没有任何全局阻塞性通信,这减少了加速器空闲时间。与 DiLoCo 相比,我们还观察到在各种模型规模和加速器数量范围内,收敛速度可快出约 4%。

关键词

引用

@article{arxiv.2506.10911,
  title  = {NoLoCo: No-all-reduce Low Communication Training Method for Large Models},
  author = {Jari Kolehmainen and Nikolay Blagoev and John Donaghy and Oğuzhan Ersoy and Christopher Nies},
  journal= {arXiv preprint arXiv:2506.10911},
  year   = {2025}
}