中文

探索大型语言模型训练中 Local SGD 的缩放律

计算与语言 2024-09-23 v1 机器学习 机器学习

摘要

本文研究了 LLM 训练中 local SGD 的缩放律,这是一种促进在连接松散的设备上进行训练的分布式优化算法。通过大量实验,我们表明在模型参数、数据集和计算资源等价的情况下,local SGD 与传统方法相比取得了具有竞争力的结果。此外,我们探索了 local SGD 在各种实际场景中的应用,包括多集群设置和边缘计算环境。我们的发现阐明了有效进行多集群 LLM 训练的必要条件,并考察了在 LLM 训练过程中利用边缘计算资源的潜力与局限性。这证明了其作为单一大集群训练替代方案的可行性。

关键词

引用

@article{arxiv.2409.13198,
  title  = {Exploring Scaling Laws for Local SGD in Large Language Model Training},
  author = {Qiaozhi He and Xiaomin Zhuang and Zhihua Wu},
  journal= {arXiv preprint arXiv:2409.13198},
  year   = {2024}
}

备注

Technical Report