INTELLECT-1 技术报告
分布式、并行与集群计算
2024-12-03 v1
摘要
本报告介绍了 INTELLECT-1,即首个由全球协作训练的 1000 亿参数语言模型,表明大规模模型训练不再局限于大型企业,而可以通过分布式、社区驱动的方式实现。INTELLECT-1 使用最高 14 个并行节点分布在 3 大洲,由 30 个独立计算提供商动态加入和离开训练过程,在保持 83-96% 计算利用率和 36.2-41.4% 模型 FLOPS 利用率的同时进行训练。我们采用 PRIME 作为可扩展的分布式训练框架,专为在不可靠的全球分布节点上实现容错、高性能训练而设计。PRIME 的关键创新包括 ElasticDeviceMesh(用于管理跨互联网的容错通信的全局进程组以及节点内部通信的本地进程组)、实时检查点恢复内核以及混合 DiLoCo-FSDP2 实现。借助 PRIME配合 DiLoCo和我们的自定义 int8 all-reduce,我们在传统数据并行训练设置下实现了通信带宽降低 400 倍,同时保持与传统方法相当的性能。这些结果表明,在去中心化的全球 GPU 资源网络中训练前沿基础模型是可行且有前景的。
引用
@article{arxiv.2412.01152,
title = {INTELLECT-1 Technical Report},
author = {Sami Jaghouar and Jack Min Ong and Manveer Basra and Fares Obeid and Jannik Straube and Michael Keiblinger and Elie Bakouch and Lucas Atkins and Maziyar Panahi and Charles Goddard and Max Ryabinin and Johannes Hagemann},
journal= {arXiv preprint arXiv:2412.01152},
year = {2024}
}
备注
19 pages, 6 figures