非均匀到均匀量化:通过广义直通估计实现准确量化
计算机视觉与模式识别
2022-04-08 v2 人工智能
机器学习
摘要
用于压缩神经网络的非均匀量化策略由于其更强的表示能力,通常比其对应策略即均匀策略取得更好的性能。然而,许多非均匀量化方法忽视了在实现非均匀量化权重/激活时的复杂投影过程,这在硬件部署中带来了不可忽略的时间和空间开销。在本研究中,我们提出非均匀到均匀量化(N2UQ),一种能够保持非均匀方法的强表示能力,同时像均匀量化那样对模型推理硬件友好且高效的方法。我们通过学习灵活的等距不等输入阈值以更好地拟合底层分布,同时将这些实值输入量化为等距输出电平来实现这一点。为了以可学习输入阈值训练量化网络,我们引入了广义直通估计器(G-STE)用于关于阈值参数的不可微反向导数计算。此外,我们考虑熵保持正则化以进一步减少权重量化中的信息损失。即使在施加均匀量化权重和激活这一不利约束下,我们的 N2UQ 在 ImageNet 上仍以 0.5~1.7 的优势超越最先进的非均匀量化方法,证明了 N2UQ 设计的贡献。代码和模型见:https://github.com/liuzechun/Nonuniform-to-Uniform-Quantization。
引用
@article{arxiv.2111.14826,
title = {Nonuniform-to-Uniform Quantization: Towards Accurate Quantization via Generalized Straight-Through Estimation},
author = {Zechun Liu and Kwang-Ting Cheng and Dong Huang and Eric Xing and Zhiqiang Shen},
journal= {arXiv preprint arXiv:2111.14826},
year = {2022}
}
备注
CVPR 2022