用于重叠通信与计算的紧迫更新:DiLoCo 中的改进方案
计算与语言
2025-02-19 v1
摘要
分布式优化方法如 DiLoCo 已被证明在训练跨多个分布式工作节点的大型模型(如数据中心)时效果良好。这些方法将更新分为两个部分:内层优化阶段,工作节点在各自的本地数据上独立执行多个优化步骤;外层优化步骤,对内层更新进行同步。在此类方法中,虽然通信需求比标准数据并行训练低一个数量级,但在工作节点为数据中心的场景下,即使有限的通信需求也可能导致显著延迟,因为每个外层优化步骤都需要阻塞。本文我们通过以一种方式重叠通信与计算来缓解此问题,使外层优化步骤能够完全与内层优化阶段重叠。我们表明,一种称为“紧迫更新”的特定变体,在工作节点之间带宽较低的场景下,能够与标准 DiLoCo 保持竞争的性能。
引用
@article{arxiv.2502.12996,
title = {Eager Updates For Overlapped Communication and Computation in DiLoCo},
author = {Satyen Kale and Arthur Douillard and Yanislav Donchev},
journal= {arXiv preprint arXiv:2502.12996},
year = {2025}
}
备注
arXiv admin note: text overlap with arXiv:2501.18512