中文

用于神经网络压缩的量化稀疏权重分解

机器学习 2022-07-25 v1

摘要

在本文中,我们提出了一种新颖的神经网络权重压缩方法。在我们的方法中,我们将权重张量存储为稀疏的量化矩阵因子,其乘积在推理过程中即时计算以生成目标模型的权重。我们使用投影梯度下降方法来寻找权重张量的量化和稀疏分解。我们表明,该方法可视为权重SVD、向量量化和稀疏PCA的统一。结合端到端微调,我们的方法在准确率与模型大小的权衡上超越或与先前最先进(SOTA)方法相当。与向量量化不同,我们的方法既适用于中等压缩场景,也适用于极端压缩场景。

关键词

引用

@article{arxiv.2207.11048,
  title  = {Quantized Sparse Weight Decomposition for Neural Network Compression},
  author = {Andrey Kuzmin and Mart van Baalen and Markus Nagel and Arash Behboodi},
  journal= {arXiv preprint arXiv:2207.11048},
  year   = {2022}
}