中文

MCUFormer:在内存受限的微控制器上部署视觉Transformer

计算机视觉与模式识别 2023-12-22 v3

摘要

由于GPU价格高昂且能耗大,在微控制器等IoT设备上部署深度模型对生态AI意义重大。常规方法已成功实现微控制器上高分辨率图像的卷积神经网络推理,而在诸多视觉应用中达到SOTA性能的视觉Transformer的框架仍待探索。本文提出一种称为MCUFormer的硬件-算法协同优化方法,在内存极度受限的微控制器上部署视觉Transformer,联合设计Transformer架构并构建推理算子库以契合内存资源约束。具体而言,我们将一次性网络架构搜索(NAS)推广以在给定微控制器内存预算下发现任务性能最优的架构,通过考虑低秩分解维度与块分辨率来扩大现有视觉Transformer搜索空间以缩减内存。对于视觉Transformer推理算子库构建,我们通过算子融合、块嵌入分解与token覆写调度推理期内存缓冲,使内存缓冲被充分利用以适应视觉Transformer前向传播。实验结果表明,我们的MCUFormer在STM32F746微控制器上以320KB内存于ImageNet图像分类取得73.62% top-1精度。代码见 https://github.com/liangyn22/MCUFormer。

关键词

引用

@article{arxiv.2310.16898,
  title  = {MCUFormer: Deploying Vision Transformers on Microcontrollers with Limited Memory},
  author = {Yinan Liang and Ziwei Wang and Xiuwei Xu and Yansong Tang and Jie Zhou and Jiwen Lu},
  journal= {arXiv preprint arXiv:2310.16898},
  year   = {2023}
}

备注

Accepted by NeurIPS 2023