中文

OPQ:利用一次性剪枝-量化压缩深度神经网络

计算机视觉与模式识别 2022-05-24 v1 机器学习

摘要

由于深度神经网络(DNNs)通常过度参数化并拥有数百万权重参数,将这些大型 DNN 模型部署在资源受限的硬件平台(如智能手机)上具有挑战性。人们提出了大量如剪枝和量化之类的网络压缩方法以显著减小模型尺寸,其关键在于找到每层的合适压缩分配(如剪枝稀疏度与量化码本)。现有方案以迭代/人工方式获取压缩分配,同时微调压缩模型,因而存在效率问题。与现有技术不同,我们在本文中提出一种新颖的一次性剪枝-量化(OPQ),它仅利用预训练权重参数解析地求解压缩分配。在微调期间,压缩模块被固定,仅更新权重参数。据我们所知,OPQ 首个揭示了预训练模型足以同时解决剪枝与量化,而在微调阶段无需任何复杂的迭代/人工优化。此外,我们提出一种统一的通道级量化方法,强制每层的各通道共享一个公共码本,从而在不引入传统通道级量化所带来的额外开销的情况下实现低比特率分配。在 ImageNet 上使用 AlexNet/MobileNet-V1/ResNet-50 的全面实验表明,与最先进水平相比,我们的方法在获得显著更高压缩率的同时提升了准确率与训练效率。

关键词

引用

@article{arxiv.2205.11141,
  title  = {OPQ: Compressing Deep Neural Networks with One-shot Pruning-Quantization},
  author = {Peng Hu and Xi Peng and Hongyuan Zhu and Mohamed M. Sabry Aly and Jie Lin},
  journal= {arXiv preprint arXiv:2205.11141},
  year   = {2022}
}

备注

Accepted in AAAI2021 and Just upload to retrieve Arxiv DOI for Project Record