中文

基于贝叶斯推断的新型梯度稀疏化算法

机器学习 2024-09-24 v1 信息论 信号处理 math.IT

摘要

误差累积是分布式梯度下降中 Top-kk 稀疏化方法的关键组成部分。它隐式地缩放学习率,防止横向运动的减慢,但也可能恶化收敛性。本文提出一种新颖的稀疏化算法,称为正则化 Top-kk(RegTop-kk),用于控制误差累积的学习率缩放。该算法通过将梯度稀疏化视为推断问题来开发,通过最大后验估计确定贝叶斯最优稀疏掩码。它利用过去的聚合梯度来评估后验统计信息,基于此对局部梯度条目进行优先级排序。在使用 ResNet-18 在 CIFAR-10 上的数值实验表明, 在 0.1%0.1\% 稀疏率下,RegTop-kk 比标准 Top-kk 高出约 8%8\% 的准确率。

关键词

引用

@article{arxiv.2409.14893,
  title  = {Novel Gradient Sparsification Algorithm via Bayesian Inference},
  author = {Ali Bereyhi and Ben Liang and Gary Boudreau and Ali Afana},
  journal= {arXiv preprint arXiv:2409.14893},
  year   = {2024}
}

备注

To appear in Proc. IEEE International Workshop on Machine Learning for Signal Processing (MLSP) 2024