探索大型语言模型训练中 Local SGD 的缩放律
计算与语言
2024-09-23 v1 机器学习
机器学习
摘要
本文研究了 LLM 训练中 local SGD 的缩放律,这是一种促进在连接松散的设备上进行训练的分布式优化算法。通过大量实验,我们表明在模型参数、数据集和计算资源等价的情况下,local SGD 与传统方法相比取得了具有竞争力的结果。此外,我们探索了 local SGD 在各种实际场景中的应用,包括多集群设置和边缘计算环境。我们的发现阐明了有效进行多集群 LLM 训练的必要条件,并考察了在 LLM 训练过程中利用边缘计算资源的潜力与局限性。这证明了其作为单一大集群训练替代方案的可行性。
引用
@article{arxiv.2409.13198,
title = {Exploring Scaling Laws for Local SGD in Large Language Model Training},
author = {Qiaozhi He and Xiaomin Zhuang and Zhihua Wu},
journal= {arXiv preprint arXiv:2409.13198},
year = {2024}
}
备注
Technical Report