2:4稀疏性诱导的proximal算子
机器学习
2025-08-28 v1
摘要
最新硬件在AI加速器和GPU方面的进展使得能够高效计算稀疏矩阵乘法,尤其是在2个连续4个权重中设置2个为零时。然而,这种所谓的2:4稀疏性通常会以模型精度下降为代价。我们推导了一个正则化项,利用特征的局部相关性来寻找更好的稀疏掩码。我们通过推导其proximal算子来联合最小化该正则化项和局部平方损失,并显示在2:4稀疏情形下该算子具有高效求解。经过优化掩码后,我们使用掩码梯度更新进一步最小化局部平方损失。我们在 toy 问题上展示了该方法,并将其应用于对700亿参数的大型语言模型进行剪枝。在130亿参数的模型上,我们优于以前的SOTA算法,而在700亿参数的模型上,我们匹配了其性能。
关键词
引用
@article{arxiv.2501.18015,
title = {A Proximal Operator for Inducing 2:4-Sparsity},
author = {Jonas M Kübler and Yu-Xiang Wang and Shoham Sabach and Navid Ansari and Matthäus Kleindessner and Kailash Budhathoki and Volkan Cevher and George Karypis},
journal= {arXiv preprint arXiv:2501.18015},
year = {2025}
}