正则化 Top-$k$:一种用于梯度稀疏化的贝叶斯框架
机器学习
2026-02-17 v2 信息论
信号处理
math.IT
摘要
在分布式环境中,误差累积对梯度稀疏化非常有效:最初未被选中的梯度项最终会随着其累积误差超过某一阈值而被选中。这种累积本质上表现为对被选中项学习率的缩放。尽管这一特性防止了分布式梯度下降中横向移动的减速,但在某些情况下它会损害收敛性。本文提出了一种新的稀疏化方案,用于控制误差累积引起的学习率缩放。该方案的推导分为两个主要步骤:首先,将梯度稀疏化表述为逆概率(推断)问题,并将贝叶斯最优稀疏化掩码导出为最大后验估计。利用继承自 Top- 的先验分布,我们推导出一种新的稀疏化算法,可解释为 Top- 的正则化形式。我们将此算法称为正则化 Top-(RegTop-k)。它利用过去的聚合梯度来评估下一次聚合的后验统计量,随后基于这些后验统计量对局部累积梯度项进行优先级排序。我们通过各种数值实验验证了推导过程。在分布式线性回归中观察到,当 Top- 与全局最优解保持固定距离时,RegTop-k 在显著更高的压缩率下收敛至全局最优解。我们进一步通过在 CIFAR-10 上分布式训练 ResNet-18 以及在 ImageNette 数据集上微调多个计算机视觉模型,证明了该观察结果的泛化性。数值结果证实,随着压缩率的增加,RegTop-k 稀疏化明显优于 Top-。
引用
@article{arxiv.2501.05633,
title = {Regularized Top-$k$: A Bayesian Framework for Gradient Sparsification},
author = {Ali Bereyhi and Ben Liang and Gary Boudreau and Ali Afana},
journal= {arXiv preprint arXiv:2501.05633},
year = {2026}
}
备注
This paper has been published in IEEE Transactions on Signal Processing, vol. 73, pp. 4463 - 4478, 2025. The present arXiv version contains additional experimental results. 27 pages, 8 figures, 2 tables