中文

面向移动设备的4位卷积神经网络快速实现

计算机视觉与模式识别 2020-10-21 v2

摘要

量化的低精度神经网络非常流行,因为它们需要更少的计算资源进行推理并能提供高性能,这对于实时和嵌入式识别系统至关重要。然而,它们的优势在FPGA和ASIC设备上显而易见,而通用处理器架构并非总能有效执行低比特整数计算。移动中央处理器最常用低精度神经网络模型是8位量化网络。但在许多情况下,可以对权重和激活使用更少的比特数,唯一的问题是高效实现的困难。我们引入了量化神经网络4位矩阵乘法的有效实现,并在移动ARM处理器上进行时间测量。其相比标准浮点乘法显示2.9倍加速,并比8位量化快1.5倍。我们还展示了在MIDV-500数据集上用于OCR识别的4位量化神经网络。4位量化给出95.0%准确率和48%整体推理加速,而8位量化网络给出95.4%准确率和39%加速。结果表明4位量化非常适合移动设备,带来足够好的准确率和低推理时间。

关键词

引用

@article{arxiv.2009.06488,
  title  = {Fast Implementation of 4-bit Convolutional Neural Networks for Mobile Devices},
  author = {Anton Trusov and Elena Limonova and Dmitry Slugin and Dmitry Nikolaev and Vladimir V. Arlazarov},
  journal= {arXiv preprint arXiv:2009.06488},
  year   = {2020}
}