中文

面向微控制器上 PyTorch 模型部署的深度压缩

机器学习 2021-03-31 v1

摘要

神经网络在低成本的嵌入式系统(即微控制器,MCU)上的部署近来比以往任何时候都更受关注。由于 MCU 的内存容量和计算速度有限,采用模型压缩以降低内存与计算速度需求至关重要。在本文中,我们加入了模型压缩(具体为深度压缩,Deep Compression),并进一步优化了 Unlu 此前在 arXiv 上关于在 MCU 上高效部署 PyTorch 模型的工作。首先,我们对卷积层和全连接层中的权重进行剪枝。其次,将剩余的权重和激活值从 32 位浮点数量化为 8 位整数。最后,使用前向传播函数对稀疏矩阵使用特殊数据结构进行压缩,仅存储非零权重(不影响性能和精度)。以 LeNet-5 模型为例,内存占用减少了 12.45 倍,推理速度提升了 2.57 倍。

关键词

引用

@article{arxiv.2103.15972,
  title  = {Deep Compression for PyTorch Model Deployment on Microcontrollers},
  author = {Eren Dogan and H. Fatih Ugurdag and Hasan Unlu},
  journal= {arXiv preprint arXiv:2103.15972},
  year   = {2021}
}

备注

7 pages, 1 figure