面向神经梯度的最小方差无偏 N:M 稀疏化
机器学习
2024-06-11 v3 人工智能
摘要
在深度学习中,细粒度 N:M 稀疏性可将通用矩阵乘法(GEMM)的数据占用与带宽最多减少 2 倍,并通过跳过零值计算使吞吐量翻倍。迄今为止,它主要仅被用于剪枝权重以加速前向与反向阶段。我们考察该方法如何也可用于神经梯度(即关于中间神经层输出的损失梯度)。为此,我们首先建立张量级最优性准则。先前工作旨在最小化每个剪枝块的均方误差(MSE)。我们表明,虽然 MSE 最小化对剪枝权重与激活值效果良好,但对神经梯度却灾难性地失效。相反,我们证明对神经梯度的准确剪枝需要无偏最小方差剪枝掩码。我们设计了此类专用掩码,并发现大多数情况下 1:2 稀疏性足以训练,而当不足时 2:4 稀疏性通常足够。此外,我们建议将若干此类方法结合使用,以潜在地进一步加速训练。
引用
@article{arxiv.2203.10991,
title = {Minimum Variance Unbiased N:M Sparsity for the Neural Gradients},
author = {Brian Chmiel and Itay Hubara and Ron Banner and Daniel Soudry},
journal= {arXiv preprint arXiv:2203.10991},
year = {2024}
}