中文

LSQ+:通过可学习偏移和更好的初始化改进低比特量化

计算机视觉与模式识别 2020-04-22 v1 机器学习 机器学习

摘要

与 ReLU 不同,流行的高效架构中常用的新激活函数(如 Swish、H-swish、Mish)也会产生负激活值,且正负范围不对称。典型的可学习量化方案 [PACT, LSQ] 假设激活为无符号量化,并将所有负激活量化为零,这会导致显著的性能损失。简单地使用有符号量化来容纳这些负值需要额外的符号位,这对于低比特(2-bit、3-bit、4-bit)量化而言代价高昂。为了解决这个问题,我们提出了 LSQ+,它是 LSQ 的自然扩展,其中我们引入了一种通用的非对称量化方案,具有可训练的缩放和偏移参数,能够学习以适应负激活。基于梯度的可学习量化方案通常还存在最终训练性能高度不稳定或方差较大的问题,因此需要大量的超参数调整才能达到令人满意的性能。LSQ+ 通过对量化参数使用基于 MSE 的初始化方案来缓解这一问题。我们表明,这种初始化使得多次训练运行中的最终性能方差显著降低。总体而言,LSQ+ 在 EfficientNet 和 MixNet 上展现了 SOTA 结果,并且在具有 Swish 激活的神经网络的低比特量化中显著优于 LSQ(例如:在 ImageNet 数据集上对 EfficientNet-B0 进行 W4A4 量化时提升 1.8%,W2A2 量化时提升高达 5.6%)。据我们所知,我们的工作是首个将此类架构量化到极低位宽的工作。

关键词

引用

@article{arxiv.2004.09576,
  title  = {LSQ+: Improving low-bit quantization through learnable offsets and better initialization},
  author = {Yash Bhalgat and Jinwon Lee and Markus Nagel and Tijmen Blankevoort and Nojun Kwak},
  journal= {arXiv preprint arXiv:2004.09576},
  year   = {2020}
}

备注

Camera-ready for Joint Workshop on Efficient Deep Learning in Computer Vision, CVPR 2020