ACCO:在通信重叠的分片LLM训练中累积
机器学习
2025-10-15 v3 人工智能
摘要
LLM训练依赖于使用多个GPU并行计算梯度的分布式实现。然而,在数据并行设置中同步梯度会产生通信开销,随工作者数量增长,限制了并行效率。局部优化算法可减少通信,但会产生高内存成本,因为它们阻止了优化器状态分片,限制了可扩展性。为解决此问题,我们提出了一种名为ACccumulate while COmmunicate(ACCO)的内存高效分布式LLM训练优化算法。通过同步延迟梯度的同时计算新梯度,ACCO减少了GPU空闲时间并支持异构硬件。为缓解由延迟更新导致的收敛问题,我们引入一种新技术确保训练动力学与标准分布式优化一致。与ZeRO-1相比,我们的方法在速度和异构硬件扩展性方面显著更快。
引用
@article{arxiv.2406.02613,
title = {ACCO: Accumulate While You Communicate for Communication-Overlapped Sharded LLM Training},
author = {Adel Nabli and Louis Fournier and Pierre Erbacher and Louis Serrano and Eugene Belilovsky and Edouard Oyallon},
journal= {arXiv preprint arXiv:2406.02613},
year = {2025}
}