用于神经网络压缩的量化稀疏权重分解
机器学习
2022-07-25 v1
摘要
在本文中,我们提出了一种新颖的神经网络权重压缩方法。在我们的方法中,我们将权重张量存储为稀疏的量化矩阵因子,其乘积在推理过程中即时计算以生成目标模型的权重。我们使用投影梯度下降方法来寻找权重张量的量化和稀疏分解。我们表明,该方法可视为权重SVD、向量量化和稀疏PCA的统一。结合端到端微调,我们的方法在准确率与模型大小的权衡上超越或与先前最先进(SOTA)方法相当。与向量量化不同,我们的方法既适用于中等压缩场景,也适用于极端压缩场景。
引用
@article{arxiv.2207.11048,
title = {Quantized Sparse Weight Decomposition for Neural Network Compression},
author = {Andrey Kuzmin and Mart van Baalen and Markus Nagel and Arash Behboodi},
journal= {arXiv preprint arXiv:2207.11048},
year = {2022}
}