中文

面向更快、更节能推理的混合精度神经网络量化的高效有效方法

机器学习 2024-01-12 v2 计算机视觉与模式识别

摘要

为了高效的神经网络推理,期望以最简单的网络达到最先进的精度,同时所需计算、内存和功耗最少。将网络量化为更低精度是简化网络的一种强力技术。由于网络的每一层对量化的敏感度可能不同,混合精度量化方法选择性地调整各层的精度,以在任务性能(如准确率)上实现最小的下降。为了估计层精度选择对任务性能的影响,我们引入了两种方法:i) 熵近似引导层选择(EAGL)速度快,利用权重分布的熵;ii) 精度感知层精度选择(ALPS)直观明了,依赖于层精度降低后的单轮微调。使用 EAGL 和 ALPS 进行层精度选择,ResNet-50、ResNet-101 和 BERT-base transformer 网络以 4-bit 与 2-bit 层混合恢复了全精度准确率,在整个准确率-吞吐前沿上展现出增强的性能。这些技术在多项同等对比中表现出优于现有技术的性能。值得注意的是,这是在显著更短的计算时间内达到解决方案的。

关键词

引用

@article{arxiv.2301.13330,
  title  = {Efficient and Effective Methods for Mixed Precision Neural Network Quantization for Faster, Energy-efficient Inference},
  author = {Deepika Bablani and Jeffrey L. Mckinstry and Steven K. Esser and Rathinakumar Appuswamy and Dharmendra S. Modha},
  journal= {arXiv preprint arXiv:2301.13330},
  year   = {2024}
}