基于贝叶斯推断的新型梯度稀疏化算法
机器学习
2024-09-24 v1 信息论
信号处理
math.IT
摘要
误差累积是分布式梯度下降中 Top- 稀疏化方法的关键组成部分。它隐式地缩放学习率,防止横向运动的减慢,但也可能恶化收敛性。本文提出一种新颖的稀疏化算法,称为正则化 Top-(RegTop-),用于控制误差累积的学习率缩放。该算法通过将梯度稀疏化视为推断问题来开发,通过最大后验估计确定贝叶斯最优稀疏掩码。它利用过去的聚合梯度来评估后验统计信息,基于此对局部梯度条目进行优先级排序。在使用 ResNet-18 在 CIFAR-10 上的数值实验表明, 在 稀疏率下,RegTop- 比标准 Top- 高出约 的准确率。
引用
@article{arxiv.2409.14893,
title = {Novel Gradient Sparsification Algorithm via Bayesian Inference},
author = {Ali Bereyhi and Ben Liang and Gary Boudreau and Ali Afana},
journal= {arXiv preprint arXiv:2409.14893},
year = {2024}
}
备注
To appear in Proc. IEEE International Workshop on Machine Learning for Signal Processing (MLSP) 2024