中文

DiPaCo:分布式路径组合

机器学习 2024-03-19 v1 计算与语言

摘要

机器学习(ML)的进展得益于不断扩大神经网络模型的规模。这一规模扩张是通过不断增强的工程技术实现的,这些技术对于需要在并行工作设备之间进行高带宽通信的 ML 方法至关重要。在本工作中,我们提出一种模块化架构和训练方法,称为DIstributed PAth COmposition(DiPaCo)。在训练期间,DiPaCo通过一组共享模块中的路径进行计算分布。结合一种受Local-SGD启发的优化(DiLoCo),该方法在大幅度减少通信量的同时保持模块同步。我们的做法 facilitate 跨越信道较差且异构的 worker,设计确保对 worker 故障和抢占具有鲁棒性。在推断时,仅需为每个输入执行单一路径,无需任何模型压缩。我们将其视为大规模学习的原型,一种更少同步、更模块化的新范式。我们的实验在广泛使用的C4基准上表明,对于相同的训练步数但更短的 wall-clock 时间,DiPaCo通过选择256种可能的路径中的一种(每条路径大小为1.5亿参数),超越了10亿参数稠密Transformer语言模型的性能。

关键词

引用

@article{arxiv.2403.10616,
  title  = {DiPaCo: Distributed Path Composition},
  author = {Arthur Douillard and Qixuan Feng and Andrei A. Rusu and Adhiguna Kuncoro and Yani Donchev and Rachita Chhaparia and Ionel Gog and Marc'Aurelio Ranzato and Jiajun Shen and Arthur Szlam},
  journal= {arXiv preprint arXiv:2403.10616},
  year   = {2024}
}