中文

F8Net:用于网络量化的纯定点8位乘法

计算机视觉与模式识别 2022-02-11 v1 人工智能 硬件体系结构 机器学习 神经与进化计算

摘要

神经网络量化是一种有前景的压缩技术,可以减少内存占用并节省能耗,从而可能实现实时推理。然而,量化模型与全精度模型之间存在性能差距。为了缩小这一差距,现有的量化方法在推理过程中需要高精度的INT32或全精度乘法来进行缩放或反量化。这在内存、速度和所需能量方面引入了显著的成本。为了解决这些问题,我们提出了F8Net,这是一个仅由定点8位乘法组成的新型量化框架。为了推导我们的方法,我们首先讨论了不同定点数格式的定点乘法优势,并研究了相关定点数的统计行为。其次,基于统计和算法分析,我们对不同层的权重和激活应用不同的定点格式。我们引入了一种新算法,在训练期间自动为每一层确定正确的格式。第三,我们分析了一种先前的量化算法——参数化裁剪激活(PACT)——并使用定点算术对其进行了重新表述。最后,我们统一了最近提出的量化微调方法和我们的定点方法,以展示我们方法的潜力。我们在ImageNet上使用MobileNet V1/V2和ResNet18/50验证了F8Net。与现有的使用INT32乘法或浮点算术的量化技术相比,甚至与全精度对应模型相比,我们的方法都取得了可比拟且更优的性能,达到了最先进的水平。

关键词

引用

@article{arxiv.2202.05239,
  title  = {F8Net: Fixed-Point 8-bit Only Multiplication for Network Quantization},
  author = {Qing Jin and Jian Ren and Richard Zhuang and Sumant Hanumante and Zhengang Li and Zhiyu Chen and Yanzhi Wang and Kaiyuan Yang and Sergey Tulyakov},
  journal= {arXiv preprint arXiv:2202.05239},
  year   = {2022}
}

备注

ICLR 2022 (Oral)