n-hot:面向2的幂次神经网络量化的高效位级稀疏性
计算机视觉与模式识别
2021-03-23 v1
摘要
2的幂次(PoT)量化减少了资源受限硬件上深度神经网络的位操作数量。然而,由于其有限的表示能力,PoT量化会引发严重的精度下降。由于DNN模型已应用于相对复杂的任务(例如大型数据集的分类和目标检测),因此需要提高PoT量化方法的精度。尽管一些先前的工作试图改善PoT量化的精度,但尚无工作以内存高效的方式平衡精度与计算成本。为解决该问题,我们提出了一种高效的PoT量化方案。引入了位级稀疏性;权重(或激活)被舍入为可通过n次移位操作在乘法中计算的值。我们还允许每次操作不仅为加法,也可为减法。此外,我们采用两阶段微调算法来恢复由引入位级稀疏性引发的精度下降。在COCO数据集上的目标检测模型(CenterNet,MobileNet-v2骨干网络)的实验结果表明,与均匀方法相比,我们所提方法最多将精度下降抑制在0.3%以内,同时减少约75%的操作数和11.5%的模型大小。
引用
@article{arxiv.2103.11704,
title = {n-hot: Efficient bit-level sparsity for powers-of-two neural network quantization},
author = {Yuiko Sakuma and Hiroshi Sumihiro and Jun Nishikawa and Toshiki Nakamura and Ryoji Ikegaya},
journal= {arXiv preprint arXiv:2103.11704},
year = {2021}
}
备注
10 pages, 3 figures