通过可微分神经架构搜索的卷积网络混合精度量化
计算机视觉与模式识别
2018-12-04 v1
摘要
网络量化的近期工作已大幅降低神经网络推理的时间和空间复杂度,使其能够在计算和内存资源受限的嵌入式与移动设备上部署。然而,现有量化方法通常以相同精度(位宽)表示所有权重和激活值。本文中,我们探索设计空间的一个新维度:以不同位宽量化不同层。我们将此问题表述为神经架构搜索问题,并提出一种新颖的可微分神经架构搜索(DNAS)框架,以基于梯度的优化高效探索其指数级搜索空间。实验表明,我们在 CIFAR-10 和 ImageNet 上超越了 ResNet 的最先进压缩水平。我们量化后的模型在模型尺寸减小 21.1 倍或计算成本降低 103.9 倍的情况下,仍优于基线量化模型甚至全精度模型。
引用
@article{arxiv.1812.00090,
title = {Mixed Precision Quantization of ConvNets via Differentiable Neural Architecture Search},
author = {Bichen Wu and Yanghan Wang and Peizhao Zhang and Yuandong Tian and Peter Vajda and Kurt Keutzer},
journal= {arXiv preprint arXiv:1812.00090},
year = {2018}
}