AutoQ:自动化的核级别神经网络量化
机器学习
2020-02-11 v3 机器学习
摘要
网络量化是在低功耗移动设备上部署卷积神经网络(CNNs)最硬件友好的技术之一。近期的网络量化技术对卷积层中的每个权重核独立量化以获得更高的推理精度,因为一层中的权重核表现出不同的方差,从而具有不同的冗余量。量化位宽或比特数(QBN)直接决定推理精度、延迟、能耗和硬件开销。为有效减少冗余并加速 CNN 推理,不同的权重核应以不同的 QBN 进行量化。然而,先前的工作仅使用一个 QBN 来量化每个卷积层或整个 CNN,因为为每个权重核搜索 QBN 的设计空间过大。核级别 QBN 搜索的手动启发式方法过于复杂,领域专家只能获得次优结果。即便是基于深度强化学习(DRL)深度确定性策略梯度(DDPG)的智能体也难以找到能达到合理推理精度的核级别 QBN 配置。在本文中,我们提出一种基于分层 DRL 的核级别网络量化技术 AutoQ,自动为每个权重核搜索 QBN,并为每个激活层选择另一个 QBN。与最先进的基于 DRL 的方案量化的模型相比,平均而言,由 AutoQ 量化的相同模型在达到相同推理精度的同时,将推理延迟降低 54.06%,并将推理能耗降低 50.69%。
引用
@article{arxiv.1902.05690,
title = {AutoQ: Automated Kernel-Wise Neural Network Quantization},
author = {Qian Lou and Feng Guo and Lantao Liu and Minje Kim and Lei Jiang},
journal= {arXiv preprint arXiv:1902.05690},
year = {2020}
}
备注
10 pages, 12 figures