通信高效语言模型训练可可靠且鲁棒地扩展:DiLoCo 的扩展律
机器学习
2025-03-14 v1 计算与语言
分布式、并行与集群计算
摘要
随着我们扩展到更大规模的机器学习模型,数据并行方法固有的频繁同步需求会造成显著的放缓,对进一步扩展构成关键挑战。近期研究提出了一种方法(DiLoCo),在不牺牲模型质量的前提下放宽了同步需求。然而,这些工作并未仔细分析 DiLoCo 的行为如何随模型规模变化。在本工作中,我们研究了在固定计算预算下训练 LLM 时 DiLoCo 的扩展律行为。我们关注算法因素——包括模型副本数量、超参数和 token 预算——如何以可通过扩展律准确预测的方式影响训练。我们发现 DiLoCo 随模型规模可预测且鲁棒地扩展。当调优得当时,DiLoCo 随模型规模的扩展优于数据并行训练,甚至在小模型规模下也能优于数据并行训练。我们的结果展示了 DiLoCo 比此前记录的更广泛的一组优势,包括更大的最优批量大小、随规模提升的下游泛化能力,以及在固定 token 预算下的改进评估损失。
引用
@article{arxiv.2503.09799,
title = {Communication-Efficient Language Model Training Scales Reliably and Robustly: Scaling Laws for DiLoCo},
author = {Zachary Charles and Gabriel Teston and Lucio Dery and Keith Rush and Nova Fallen and Zachary Garrett and Arthur Szlam and Arthur Douillard},
journal= {arXiv preprint arXiv:2503.09799},
year = {2025}
}