中文

面向高效网络压缩的核量化方法

机器学习 2020-03-12 v1 机器学习

摘要

本文提出了一种新颖的网络压缩框架核量化(Kernel Quantization, KQ),旨在将任何预训练的全精度卷积神经网络(CNN)模型高效转换为低精度版本而不造成显著的性能损失。与在权重比特长度上受限的现有方法不同,KQ 通过将以卷积核作为量化单元来考虑,具有提高压缩比的潜力。受从权重剪枝到滤波器剪枝演进的启发,我们提出在核和权重两个层面进行量化。我们不是用低比特索引表示每个权重参数,而是学习一个核码本,并将卷积层中的所有核替换为相应的低比特索引。因此,KQ 可以用低比特索引和大小受限的核码本来表示卷积层中的权重张量,这使 KQ 能够实现显著的压缩比。然后,我们对核码本进行 6 比特参数量化以进一步降低冗余。在 ImageNet 分类任务上的大量实验证明,KQ 在 VGG 和 ResNet18 中平均分别仅需 1.05 和 1.62 比特来表示卷积层中的每个参数,并以极小的精度损失实现了最先进的压缩比。

关键词

引用

@article{arxiv.2003.05148,
  title  = {Kernel Quantization for Efficient Network Compression},
  author = {Zhongzhi Yu and Yemin Shi and Tiejun Huang and Yizhou Yu},
  journal= {arXiv preprint arXiv:2003.05148},
  year   = {2020}
}