中文

n-hot:面向2的幂次神经网络量化的高效位级稀疏性

计算机视觉与模式识别 2021-03-23 v1

摘要

2的幂次(PoT)量化减少了资源受限硬件上深度神经网络的位操作数量。然而,由于其有限的表示能力,PoT量化会引发严重的精度下降。由于DNN模型已应用于相对复杂的任务(例如大型数据集的分类和目标检测),因此需要提高PoT量化方法的精度。尽管一些先前的工作试图改善PoT量化的精度,但尚无工作以内存高效的方式平衡精度与计算成本。为解决该问题,我们提出了一种高效的PoT量化方案。引入了位级稀疏性;权重(或激活)被舍入为可通过n次移位操作在乘法中计算的值。我们还允许每次操作不仅为加法,也可为减法。此外,我们采用两阶段微调算法来恢复由引入位级稀疏性引发的精度下降。在COCO数据集上的目标检测模型(CenterNet,MobileNet-v2骨干网络)的实验结果表明,与均匀方法相比,我们所提方法最多将精度下降抑制在0.3%以内,同时减少约75%的操作数和11.5%的模型大小。

关键词

引用

@article{arxiv.2103.11704,
  title  = {n-hot: Efficient bit-level sparsity for powers-of-two neural network quantization},
  author = {Yuiko Sakuma and Hiroshi Sumihiro and Jun Nishikawa and Toshiki Nakamura and Ryoji Ikegaya},
  journal= {arXiv preprint arXiv:2103.11704},
  year   = {2021}
}

备注

10 pages, 3 figures