中文

面向量化深度神经网络微调改进的滤波器预剪枝

计算机视觉与模式识别 2020-11-26 v2

摘要

深度神经网络(DNNs)具有大量参数和激活数据,二者在实现上均代价高昂。一种减小 DNN 规模的方法是对预训练模型进行量化,即对权重和激活采用低比特表示,并通过微调来恢复精度的下降。然而,训练使用低比特表示的神经网络通常较为困难。原因之一在于 DNN 中间层的权重具有较宽的动态范围,当将这一宽动态范围量化为少数比特时,量化步长变大,从而导致较大的量化误差,并最终造成明显的精度退化。为解决该问题,本文在不使用任何额外学习参数与超参数的前提下作出以下三点贡献。首先,我们分析了导致上述问题的批归一化(batch normalization)如何干扰量化 DNN 的微调。其次,基于这些结果,我们提出一种称为面向量化的剪枝(Pruning for Quantization, PfQ)的新剪枝方法,该方法在尽可能不影响推理结果的前提下,移除那些干扰 DNN 微调的滤波器。第三,我们提出一种利用所提剪枝方法(PfQ)对量化 DNN 进行微调的工作流程。使用知名模型与数据集的实验证实,相较于包括微调在内的传统量化方法,所提方法在模型规模相近时取得了更高的性能。

关键词

引用

@article{arxiv.2011.06751,
  title  = {Filter Pre-Pruning for Improved Fine-tuning of Quantized Deep Neural Networks},
  author = {Jun Nishikawa and Ryoji Ikegaya},
  journal= {arXiv preprint arXiv:2011.06751},
  year   = {2020}
}

备注

updated for ICLR2021 OpenReview rebuttal