一种兼容 All-Reduce 的 Top-K 压缩器:用于分布式学习的通信高效压缩
机器学习
2025-11-05 v3 分布式、并行与集群计算
摘要
在大规模分布式机器学习中,通信仍是核心瓶颈,梯度稀疏化已成为缓解此挑战的有前景策略。然而,现有梯度压缩器面临显著局限:Rand- 丢弃结构信息,实际效果不佳;而 Top- 保留信息丰富的条目,但失去收敛属性,需进行高成本的 All-Gather 操作。本文提出 ARC-Top-,一种兼容 All-Reduce 的 Top- 压缩器,通过对梯度进行轻量级草图,实现跨节点稀疏模式对齐,无需索引即可完成 All-Reduce,同时保留全局关键信息。ARC-Top- 在理论上具有收敛性,结合动量误差反馈 (EF21M) 可实现线性加速,收敛率优于原始 EF21M。实验表明,ARC-Top- 在保持 Top- 精度的同时,将墙钟训练时间缩短最高可达 60.7%,提供一种兼具 Rand- 鲁棒性与 Top- 强性能的高效可扩展解决方案。
关键词
引用
@article{arxiv.2510.26709,
title = {An All-Reduce Compatible Top-K Compressor for Communication-Efficient Distributed Learning},
author = {Chuyan Chen and Chenyang Ma and Zhangxin Li and Yutong He and Yanjie Dong and Kun Yuan},
journal= {arXiv preprint arXiv:2510.26709},
year = {2025}
}
备注
8 pages, 2 figures