MCUNetV2:面向微型深度学习的内存高效分块推理
计算机视觉与模式识别
2024-04-04 v2
摘要
微控制器单元(MCUs)上的微型深度学习因内存大小有限而具挑战性。我们发现内存瓶颈源于卷积神经网络(CNN)设计中不均衡的内存分布:前几个块的内存用量比网络其余部分大一个数量级。为缓解该问题,我们提出一种通用的逐块推理调度,其仅在特征图的小空间区域上操作,显著削减峰值内存。然而,朴素实现会带来重叠图块与计算开销。我们进一步提出网络重分布,将感受野与 FLOPs 转移到后段并降低计算开销。手动重分布感受野是困难的。我们用神经架构搜索自动化该过程,以联合优化神经架构与推理调度,从而得到 MCUNetV2。基于图块的推理将现有网络的峰值内存用量有效降低 4–8 倍。与神经网络协同设计后,MCUNetV2 在 MCU 上创下 ImageNet 准确率纪录(71.8%),并在仅 32kB SRAM 下于视觉唤醒词数据集取得 >90% 准确率。MCUNetV2 还解锁了微型设备上的目标检测,在 Pascal VOC 上相较 SOTA 结果取得高 16.9% 的 mAP。我们的研究大幅解决了 tinyML 中的内存瓶颈,并为图像分类之外的多种视觉应用铺平道路。
引用
@article{arxiv.2110.15352,
title = {MCUNetV2: Memory-Efficient Patch-based Inference for Tiny Deep Learning},
author = {Ji Lin and Wei-Ming Chen and Han Cai and Chuang Gan and Song Han},
journal= {arXiv preprint arXiv:2110.15352},
year = {2024}
}