中文

2:4稀疏性诱导的proximal算子

机器学习 2025-08-28 v1

摘要

最新硬件在AI加速器和GPU方面的进展使得能够高效计算稀疏矩阵乘法,尤其是在2个连续4个权重中设置2个为零时。然而,这种所谓的2:4稀疏性通常会以模型精度下降为代价。我们推导了一个正则化项,利用特征的局部相关性来寻找更好的稀疏掩码。我们通过推导其proximal算子来联合最小化该正则化项和局部平方损失,并显示在2:4稀疏情形下该算子具有高效求解。经过优化掩码后,我们使用掩码梯度更新进一步最小化局部平方损失。我们在 toy 问题上展示了该方法,并将其应用于对700亿参数的大型语言模型进行剪枝。在130亿参数的模型上,我们优于以前的SOTA算法,而在700亿参数的模型上,我们匹配了其性能。

关键词

引用

@article{arxiv.2501.18015,
  title  = {A Proximal Operator for Inducing 2:4-Sparsity},
  author = {Jonas M Kübler and Yu-Xiang Wang and Shoham Sabach and Navid Ansari and Matthäus Kleindessner and Kailash Budhathoki and Volkan Cevher and George Karypis},
  journal= {arXiv preprint arXiv:2501.18015},
  year   = {2025}
}