改进的量化策略以管理分布式学习中的重尾梯度
机器学习
2024-02-07 v1 分布式、并行与集群计算
摘要
梯度压缩已成为解决分布式学习中通信效率挑战的关键技术。然而,在分布式深度学习中,观察到梯度分布具有重尾特性,异常值显著影响压缩策略的设计。当忽略这一重尾特征时,现有的参数量化方法会出现性能下降。本文提出了一种专门针对重尾梯度的新型压缩方案,该方案有效地结合了梯度截断与量化。该方案巧妙地实现在通信受限的分布式随机梯度下降(SGD)框架中。我们考虑遵循幂律分布的一般重尾梯度族,旨在最小化量化产生的误差,从而确定两个关键参数的最优值:截断阈值和量化密度。我们提供了在均匀和非均匀量化场景下收敛误差界的理论分析。与其他基准方法的对比实验证明了我们提出的方法在分布式学习环境中管理重尾梯度的有效性。
引用
@article{arxiv.2402.01798,
title = {Improved Quantization Strategies for Managing Heavy-tailed Gradients in Distributed Learning},
author = {Guangfeng Yan and Tan Li and Yuanzhang Xiao and Hanxu Hou and Linqi Song},
journal= {arXiv preprint arXiv:2402.01798},
year = {2024}
}
备注
arXiv admin note: substantial text overlap with arXiv:2402.01160