中文

异构低带宽 LLM 预训练

机器学习 2026-01-06 v1

摘要

大语言模型 (LLM) 的预训练日益需要分布式计算,但带宽限制使其难以扩展到充足配置的数据中心中—特别是当模型并行需要频繁且大规模的设备间通信时。我们研究稀疏低联合 (SparseLoCo) 这种基于不频繁同步和稀疏伪梯度交换的数据并行方法,是否可以与通过激活和激活梯度压缩的低带宽流水线模型并行相结合。我们引入一种异构分布式训练框架,其中一些参与者在高带宽互连上托管完整副本,而资源受限的参与者被分组以使用流水线并行方式联合实例化副本,并通过子空间投影进行阶段间通信。为使最近引入的子空间流水线压缩与 SparseLoCo 兼容,我们研究了各种改编方案。在规模为 1.78B-1B 参数的大规模语言建模实验中,我们发现激活压缩与 SparseLoCo 组合成本适中,而选择性(异构)压缩始终比压缩所有副本在损失-通信权衡方面表现更好—尤其是在激进的压缩比下。这些结果表明,将低带宽模型并行和异构参与者纳入 LLM 预训练具有实际可行性。

关键词

引用

@article{arxiv.2601.02360,
  title  = {Heterogeneous Low-Bandwidth Pre-Training of LLMs},
  author = {Yazan Obeidi and Amir Sarfi and Joel Lidin and Paul Janson and Eugene Belilovsky},
  journal= {arXiv preprint arXiv:2601.02360},
  year   = {2026}
}