通过联合应用剪枝与量化的自动化模型压缩
计算机视觉与模式识别
2020-11-13 v1 人工智能
摘要
在传统的深度压缩框架中,迭代执行网络剪枝和量化可减小模型尺寸和计算成本以满足部署要求。然而,这种逐步应用剪枝和量化的方式可能导致次优解和不必要的时间消耗。在本文中,我们将网络剪枝和量化整合为一个统一的联合压缩问题,然后利用 AutoML 自动求解,以应对该问题。我们发现剪枝过程可视为 0 比特的通道级量化。因此,分离的两步剪枝与量化可简化为具有混合精度的单步量化。这种统一不仅简化了压缩流程,还避免了压缩发散。为实现该想法,我们提出了通过联合应用剪枝与量化的自动化模型压缩(AJPQ)。AJPQ 采用分层架构设计:层控制器控制层稀疏度,通道控制器决定每个核的位宽。遵循相同的重要性准则,层控制器和通道控制器协同决定压缩策略。在强化学习的帮助下,我们的单步压缩自动实现。与最先进的自动化压缩方法相比,我们的方法在显著减少存储的同时获得了更好的准确率。对于固定精度量化,AJPQ 在遥感目标检测的 Skynet 上可减小超过五倍的模型尺寸和两倍的算力且性能略有提升。当允许混合精度时,AJPQ 在分类任务的 MobileNet 上仅以 1.06% 的 top-5 准确率下降实现五倍模型尺寸缩减。
引用
@article{arxiv.2011.06231,
title = {Automated Model Compression by Jointly Applied Pruning and Quantization},
author = {Wenting Tang and Xingxing Wei and Bo Li},
journal= {arXiv preprint arXiv:2011.06231},
year = {2020}
}