中文

面向微控制器深度网络推理的内存驱动混合低精度量化

机器学习 2019-05-31 v1 机器学习

摘要

本文提出了一种新颖的端到端方法,用于在微控制器上部署低误差深度网络。为适应资源受限边缘设备的存储与计算限制,我们采用混合低比特宽度压缩,包含 8、4 或 2 位均匀量化,并以纯整数运算对推理图进行建模。我们的方法旨在给定设备内存约束下,确定每个激活与权重张量的最小比特精度。这通过基于规则的迭代过程实现,该过程削减内存需求最大层的比特数,以力求满足内存约束。在量化感知重训练步骤后,通过插入整数通道归一化(ICN)层,将伪量化图转换为纯整数推理模型,其在 INT4 MobilenetV1 模型上引入了可忽略的损失。我们报告了 STM32H7 微控制器上混合精度 MobilenetV1 系列网络的延迟-精度评估。实验结果表明,在仅有 2MB FLASH 内存与 512kB RAM 的设备上实现了纯整数 Mobilenet 网络的端到端部署,Top1 精度达 68%,相较先前发表的微控制器 8 位实现,Top1 精度提升 8%。

关键词

引用

@article{arxiv.1905.13082,
  title  = {Memory-Driven Mixed Low Precision Quantization For Enabling Deep Network Inference On Microcontrollers},
  author = {Manuele Rusci and Alessandro Capotondi and Luca Benini},
  journal= {arXiv preprint arXiv:1905.13082},
  year   = {2019}
}

备注

Submitted to NeurIPS 2019