中文

一种兼容 All-Reduce 的 Top-K 压缩器:用于分布式学习的通信高效压缩

机器学习 2025-11-05 v3 分布式、并行与集群计算

摘要

在大规模分布式机器学习中,通信仍是核心瓶颈,梯度稀疏化已成为缓解此挑战的有前景策略。然而,现有梯度压缩器面临显著局限:Rand-KK 丢弃结构信息,实际效果不佳;而 Top-KK 保留信息丰富的条目,但失去收敛属性,需进行高成本的 All-Gather 操作。本文提出 ARC-Top-KK,一种兼容 All-Reduce 的 Top-KK 压缩器,通过对梯度进行轻量级草图,实现跨节点稀疏模式对齐,无需索引即可完成 All-Reduce,同时保留全局关键信息。ARC-Top-KK 在理论上具有收敛性,结合动量误差反馈 (EF21M) 可实现线性加速,收敛率优于原始 EF21M。实验表明,ARC-Top-KK 在保持 Top-KK 精度的同时,将墙钟训练时间缩短最高可达 60.7%,提供一种兼具 Rand-KK 鲁棒性与 Top-KK 强性能的高效可扩展解决方案。

关键词

引用

@article{arxiv.2510.26709,
  title  = {An All-Reduce Compatible Top-K Compressor for Communication-Efficient Distributed Learning},
  author = {Chuyan Chen and Chenyang Ma and Zhangxin Li and Yutong He and Yanjie Dong and Kun Yuan},
  journal= {arXiv preprint arXiv:2510.26709},
  year   = {2025}
}

备注

8 pages, 2 figures