面向稀疏CNN的聚焦量化
机器学习
2019-10-30 v3 机器学习
摘要
深度卷积神经网络(CNN)是处理广泛视觉任务的强大工具,但CNN所需的巨大内存和计算资源给其在受限设备上的部署带来了挑战。现有的压缩技术在减小模型尺寸方面表现出色,却难以做到计算友好。在本文中,我们关注稀疏CNN的统计特性,提出聚焦量化,一种基于2的幂次值的新型量化策略,其利用细粒度剪枝后的权重分布。所提方法动态地为具有不同稀疏度的层中的权重发现最有效的数值表示,显著减小了模型尺寸。量化CNN中的乘法被替换为更廉价的位移位运算以实现高效推理。结合无损编码,我们构建了一个压缩流水线,为CNN提供高压缩比(CR)、低计算成本和最小的精度损失。在ResNet-50中,我们实现了18.08倍的CR且top-5精度仅损失0.24%,优于现有的压缩方法。我们完全压缩了一个ResNet-18,发现其不仅具有更高的CR和top-5精度,而且硬件效率更高,因为在相同吞吐量假设下与其他最先进的量化方法相比,其实现需要更少的逻辑门。
引用
@article{arxiv.1903.03046,
title = {Focused Quantization for Sparse CNNs},
author = {Yiren Zhao and Xitong Gao and Daniel Bates and Robert Mullins and Cheng-Zhong Xu},
journal= {arXiv preprint arXiv:1903.03046},
year = {2019}
}
备注
To appear in NeurIPS 2019, this is the same paper adapted for viewing on arXiv. TL;DR: Better size/accuracy trade-off of compressed sparse models with focused quantization. 11 pages, 5 figures, 4 tables