Quantune:利用极端梯度提升对卷积神经网络进行训练后量化以实现快速部署
机器学习
2022-02-22 v2
摘要
为了将卷积神经网络(CNN)应用于各种资源受限的目标,有必要通过执行量化来压缩 CNN 模型,即将高精度表示转换为较低位表示。为了克服训练数据集敏感性、高计算需求和大时间消耗等问题,人们提出了不需要重新训练的训练后量化方法。此外,为了在不重新训练的情况下补偿精度下降,先前关于训练后量化的研究提出了几种互补方法:校准、方案、裁剪、粒度和混合精度。为了生成误差最小的量化模型,有必要研究这些方法的所有可能组合,因为每种方法都是互补的,并且 CNN 模型具有不同的特性。然而,穷举搜索或启发式搜索要么过于耗时,要么是次优的。为了克服这一挑战,我们提出了一种名为 Quantune 的自动调谐器,它构建了一个梯度提升树模型来加速量化配置的搜索并减少量化误差。我们评估并比较了 Quantune 与随机算法、网格算法和遗传算法。实验结果表明,在包括脆弱模型(MobileNet、SqueezeNet 和 ShuffleNet)在内的六种 CNN 模型上,Quantune 将量化搜索时间减少了约 36.5 倍,精度损失为 0.07% 至 0.65%。为了支持多个目标并采用不断发展的量化工作,Quantune 在一个功能齐全的深度学习编译器上实现,并作为一个开源项目发布。
引用
@article{arxiv.2202.05048,
title = {Quantune: Post-training Quantization of Convolutional Neural Networks using Extreme Gradient Boosting for Fast Deployment},
author = {Jemin Lee and Misun Yu and Yongin Kwon and Taeho Kim},
journal= {arXiv preprint arXiv:2202.05048},
year = {2022}
}
备注
13 page, 9 figures, Accepted in Future Generation Computer Systems