用于均匀神经网络量化的快速可调阈值(LPIRC-II冠军方案)
机器学习
2019-06-27 v3 机器学习
摘要
神经网络量化是将神经网络移植到移动设备的必要步骤。量化可加速推理、减少内存消耗与模型大小。它可在无需微调的情况下通过校准过程(计算量化所需参数)执行,也可从头开始训练带量化的网络。在标注数据上从头训练带量化的网络是相当漫长且耗费资源的流程。无微调的网络量化会因校准期间出现的离群值而导致精度下降。本文中,我们提出通过引入用于量化阈值的已训练缩放因子来显著简化量化过程。它使得带微调的量化过程加速至最多8个epoch,并降低对训练图像集的要求。据我们所知,所提方法使我们获得了首个公开可用的MNAS量化版本且无显著精度损失——74.8%对比原始全精度网络的75.3%。模型与代码已可供使用,见:https://github.com/agoncharenko1992/FAT-fast_adjustable_threshold。
引用
@article{arxiv.1812.07872,
title = {Fast Adjustable Threshold For Uniform Neural Network Quantization (Winning solution of LPIRC-II)},
author = {Alexander Goncharenko and Andrey Denisov and Sergey Alyamkin and Evgeny Terentev},
journal= {arXiv preprint arXiv:1812.07872},
year = {2019}
}