面向深度神经网络高能效实现的训练后量化
机器学习
2022-10-17 v1 人工智能
计算机视觉与模式识别
摘要
在边缘设备上将深度神经网络(DNNs)部署于靠近生成数据的位置,其最大挑战在于模型规模,即内存占用与计算复杂度。二者均可通过量化显著减小。随着字长的降低,DNNs的能效成比例提升。然而,较低字长通常会导致精度下降。为抵消该影响,需对量化后的DNN进行重训练。遗憾的是,训练所耗能量高达量化DNN推理的5000倍。为解决此问题,我们提出了一种无需重训练的训练后量化流程。为此,我们研究了不同的量化方案。此外,我们的分析系统性地评估了权重与激活值字长缩减的影响,揭示了字长选择的明确趋势。这两方面此前均未被系统性研究。我们的结果独立于DNNs的深度,且适用于均匀量化,从而实现对给定预训练DNN的快速量化。在ImageNet上,我们以6比特取得优于现有最优(SOTA)2.2%的Top-1精度。无需重训练,我们量化至8比特即超越浮点精度。
引用
@article{arxiv.2210.07906,
title = {Post-Training Quantization for Energy Efficient Realization of Deep Neural Networks},
author = {Cecilia Latotzke and Batuhan Balim and Tobias Gemmeke},
journal= {arXiv preprint arXiv:2210.07906},
year = {2022}
}
备注
memory footprint, MSE, residuals, scale computation, channelwise, layerwise, word-length, bit-width