DynamiQ:基于压缩多跳 All-Reduce 加速梯度同步
机器学习
2026-02-10 v1 分布式、并行与集群计算
网络与互联网体系结构
摘要
多跳 All-Reduce 是大规模模型训练事实上的 backbone。随着训练规模的增加,网络常常成为瓶颈,激发了减少传输数据 volumes 的动机。因此,最近的系统 demonstrated 采用梯度量化可显著加速训练过程。然而,这些系统针对多跳聚合进行优化,其中条目在其聚合拓扑中多次部分求和。本文提出 DynamiQ,一种量化框架,弥合量化最佳实践与多跳聚合之间的鸿沟。DynamiQ 引入新技术以更好地表示部分和,配合一种用于快速执行的解压-累积-重新压缩融合内核。我们将 PyTorch DDP 扩展以支持 DynamiQ 基于 NCCL P2P,跨不同的 LLMs、任务和规模,我们展示了相对于诸如 Omni-Reduce、THC 等最先进方法以及新兴标准如 MXFP4、MXFP6 和 MXFP8 的一致性改进最高可达 34.2%。进一步地,DynamiQ 是唯一一个在不同方法中始终达到接近基准精度(例如 99.9% 的 BF16 基准)且显著加速训练的方法。
引用
@article{arxiv.2602.08923,
title = {DynamiQ: Accelerating Gradient Synchronization using Compressed Multi-hop All-reduce},
author = {Wenchen Han and Shay Vargaftik and Michael Mitzenmacher and Ran Ben Basat},
journal= {arXiv preprint arXiv:2602.08923},
year = {2026}
}
备注
18 pages, 18 figures