中文

大型语言模型预训练的未来是联邦的

机器学习 2024-10-15 v3 人工智能 分布式、并行与集群计算

摘要

生成式预训练大型语言模型 (LLMs) 因其训练数据量 unprecedented 而在广泛的任务上展现出惊人的性能。鉴于 established 的比例规律,LLMs 的未来性能提升取决于其可用于预训练的计算资源和数据来源。联邦学习 (FL) 有潜力释放地球上大部分数据和计算资源,这些资源被数据中心专注的当前 LLM 实践方法所 underutilize。我们的工作提出一种 robust、 flexible、可重复的 FL 方法,使大规模机构间合作训练 LLMs 成为可能。我们提出了称为 Photon 的可扩展部署系统,以实现此新训练范式的探索和开发。我们展示了 Photon 可用于组织之间利用私有数据源和计算资源进行 LLM 预训练。这种范式将动员更多计算和数据资源,同时匹配或可能超越集中式性能。我们进一步展示了联邦训练规模随模型大小呈现有效性,并提出了使用有限资源训练十亿参数规模的联邦 LLMs 的方法。迄今为止,我们使用 Photon 训练了 7B 参数规模的 LLM 模型,预计在不久的将来将完成更大规模的模型。最后,我们展示了 LLM 训练对经典联邦统计和硬件异构性具有高度鲁棒性。我们进一步表明,收敛对部分参与也稳健,为计算高效的协作训练开辟了道路。Photon 将帮助数据丰富的参与者成为 LLM 预训练的主导者,而不是仅仅让计算丰富的参与者独自承担。

关键词

引用

@article{arxiv.2405.10853,
  title  = {The Future of Large Language Model Pre-training is Federated},
  author = {Lorenzo Sani and Alex Iacob and Zeyu Cao and Bill Marino and Yan Gao and Tomas Paulik and Wanru Zhao and William F. Shen and Preslav Aleksandrov and Xinchi Qiu and Nicholas D. Lane},
  journal= {arXiv preprint arXiv:2405.10853},
  year   = {2024}
}

备注

24 pages, 15 figures, pre-print