中文

Photon:联邦大语言模型预训练

机器学习 2024-11-06 v1 分布式、并行与集群计算

摘要

扩展大语言模型需要大量的数据和计算资源,传统上由于分布式训练的高带宽需求,这些资源被限制在数据中心内。像联邦学习这样的低带宽方法,如果能够有效地用于预训练,则可以在弱连接的GPU上实现更大模型的协作训练。为此,我们引入了Photon,这是第一个用于联邦端到端大语言模型训练的完整系统,它利用跨孤岛联邦学习以最小的通信开销进行全球范围的训练。使用Photon,我们从零开始训练了第一个仅解码器大语言模型的联邦系列。我们表明:(1) Photon能够以联邦方式训练高达7B的模型大小,同时达到甚至优于集中式预训练的困惑度;(2) Photon的模型训练时间随可用计算资源增加而减少,实现了与集中式训练相似的计算-时间权衡;(3) 通过通信量减少64倍至512倍,Photon的耗时比基线分布式训练方法快35%。我们的方法对数据异质性具有鲁棒性,并且收敛速度是DiLoCo等先前方法的两倍。这种惊人的数据效率源于一种独特的方法,该方法将小的客户端批量大小与极高的学习率相结合,这得益于联邦平均对超参数的鲁棒性。因此,Photon代表了第一个用于全球互联网范围大语言模型预训练的经济系统。

关键词

引用

@article{arxiv.2411.02908,
  title  = {Photon: Federated LLM Pre-Training},
  author = {Lorenzo Sani and Alex Iacob and Zeyu Cao and Royson Lee and Bill Marino and Yan Gao and Dongqi Cai and Zexi Li and Wanru Zhao and Xinchi Qiu and Nicholas D. Lane},
  journal= {arXiv preprint arXiv:2411.02908},
  year   = {2024}
}

备注

13 pages, 9 appendix pages, 10 figures, 3 algorithms, 8 tables