F8Net:用于网络量化的纯定点8位乘法
计算机视觉与模式识别
2022-02-11 v1 人工智能
硬件体系结构
机器学习
神经与进化计算
摘要
神经网络量化是一种有前景的压缩技术,可以减少内存占用并节省能耗,从而可能实现实时推理。然而,量化模型与全精度模型之间存在性能差距。为了缩小这一差距,现有的量化方法在推理过程中需要高精度的INT32或全精度乘法来进行缩放或反量化。这在内存、速度和所需能量方面引入了显著的成本。为了解决这些问题,我们提出了F8Net,这是一个仅由定点8位乘法组成的新型量化框架。为了推导我们的方法,我们首先讨论了不同定点数格式的定点乘法优势,并研究了相关定点数的统计行为。其次,基于统计和算法分析,我们对不同层的权重和激活应用不同的定点格式。我们引入了一种新算法,在训练期间自动为每一层确定正确的格式。第三,我们分析了一种先前的量化算法——参数化裁剪激活(PACT)——并使用定点算术对其进行了重新表述。最后,我们统一了最近提出的量化微调方法和我们的定点方法,以展示我们方法的潜力。我们在ImageNet上使用MobileNet V1/V2和ResNet18/50验证了F8Net。与现有的使用INT32乘法或浮点算术的量化技术相比,甚至与全精度对应模型相比,我们的方法都取得了可比拟且更优的性能,达到了最先进的水平。
引用
@article{arxiv.2202.05239,
title = {F8Net: Fixed-Point 8-bit Only Multiplication for Network Quantization},
author = {Qing Jin and Jian Ren and Richard Zhuang and Sumant Hanumante and Zhengang Li and Zhiyu Chen and Yanzhi Wang and Kaiyuan Yang and Sergey Tulyakov},
journal= {arXiv preprint arXiv:2202.05239},
year = {2022}
}
备注
ICLR 2022 (Oral)