基于二值化与少量全精度权重的神经网络压缩
计算机视觉与模式识别
2023-09-18 v2 机器学习
摘要
量化和剪枝是两种有效的深度神经网络模型压缩方法。本文提出自动剪枝二值化(APB),一种结合量化与剪枝的新型压缩技术。APB利用少量全精度权重增强二值网络的表征能力。我们的技术通过决定每个权重应被二值化还是保留为全精度,在最大化网络精度的同时最小化其内存占用。我们展示了如何通过将该层分解为二值矩阵与稀疏稠密矩阵乘法,对使用APB压缩的层高效执行前向传播。此外,我们设计了两种新颖的高效CPU上极量化矩阵乘法算法,利用高度高效的按位运算。所提算法比现有最优方案分别快6.9倍和1.5倍。我们在两个广泛采用的模型压缩数据集CIFAR10和ImageNet上广泛评估APB。相比基于i)量化、ii)剪枝、iii)剪枝与量化结合的最优方法,APB在精度/内存权衡上更优。APB在精度/效率权衡上优于量化,比2-bit量化模型快至多2倍且精度无损失。
引用
@article{arxiv.2306.08960,
title = {Neural Network Compression using Binarization and Few Full-Precision Weights},
author = {Franco Maria Nardini and Cosimo Rulli and Salvatore Trani and Rossano Venturini},
journal= {arXiv preprint arXiv:2306.08960},
year = {2023}
}
备注
15 pages, 6 figures, 3 tables