中文

深度压缩:通过剪枝、训练量化和霍夫曼编码压缩深度神经网络

计算机视觉与模式识别 2016-02-16 v5 神经与进化计算

摘要

神经网络在计算和内存上均密集,难以部署在硬件资源有限的嵌入式系统上。为解决此限制,我们引入“深度压缩”,一种三阶段流水线:剪枝、训练量化和霍夫曼编码,它们协同工作,在不影响精度的情况下将神经网络的存储需求降低35倍至49倍。我们的方法首先通过仅学习重要连接来剪枝网络。接下来,我们量化权重以强制权重共享,最后应用霍夫曼编码。在前两步之后,我们重新训练网络以微调剩余连接和量化质心。剪枝将连接数减少9倍至13倍;量化随后将表示每个连接的比特数从32降至5。在ImageNet数据集上,我们的方法将AlexNet所需存储降低35倍,从240MB到6.9MB,且无精度损失。我们的方法将VGG-16的大小降低49倍,从552MB到11.3MB,同样无精度损失。这使得模型能放入片上SRAM缓存而非片外DRAM内存。我们的压缩方法还促进了在应用大小和下载带宽受限的移动应用中使用复杂神经网络。在CPU、GPU和移动GPU上基准测试,压缩网络有3倍至4倍的逐层加速和3倍至7倍的更好能效。

关键词

引用

@article{arxiv.1510.00149,
  title  = {Deep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman Coding},
  author = {Song Han and Huizi Mao and William J. Dally},
  journal= {arXiv preprint arXiv:1510.00149},
  year   = {2016}
}

备注

Published as a conference paper at ICLR 2016 (oral)