利用网络敏感度与梯度的深度学习模型压缩
机器学习
2022-10-12 v1 计算机视觉与模式识别
摘要
深度学习模型压缩是用于深度学习模型边缘部署的一个不断改进且重要的领域。鉴于模型尺寸及其相应功耗的不断增加,在模型性能无显著下降的情况下减小模型尺寸和计算需求至关重要。在本文中,我们提出了适用于非重训练和重训练两种情况的模型压缩算法。在第一种情况下,由于无法访问原始数据或缺乏必要的计算资源而仅能使用现成模型,导致模型重训练不可行,我们提出了 Bin & Quant 算法,利用网络参数的敏感度来压缩深度学习模型。这实现了语音指令与控制模型 13 倍的压缩以及 DeepSpeech2 模型 7 倍的压缩。在第二种情况下,当模型可以重训练且在精度损失可忽略不计的情况下需要极致压缩时,我们提出了新颖的梯度加权 k-means 聚类算法 (GWK)。该方法利用梯度来识别给定聚类中的重要权重值,并将质心向这些值微调,从而赋予敏感权重以重要性。我们的方法将乘积量化与 EWGS[1] 算法有效结合,实现了量化模型的亚 1 比特表示。我们在 CIFAR10 数据集上跨 ResNet20、ResNet56、MobileNetv2 等一系列模型测试了我们的 GWK 算法,结果表明在精度绝对损失不到 2% 的情况下,量化模型实现了 35 倍的压缩。
关键词
引用
@article{arxiv.2210.05111,
title = {Deep learning model compression using network sensitivity and gradients},
author = {Madhumitha Sakthi and Niranjan Yadla and Raj Pawate},
journal= {arXiv preprint arXiv:2210.05111},
year = {2022}
}