用于TinyML深度神经网络推理内存优化的融合逐通道分块方法
机器学习
2023-04-03 v1
摘要
随着TinyML(即在微型低功耗微控制器上部署深度神经网络推理任务)的出现,深度神经网络(DNN)推理的内存优化变得极为重要。诸如音频关键词检测或基于雷达的手势识别等应用,受限于此类微型设备上有限的内存,因为DNN推理需要大型中间运行时缓冲区来存储激活值及其他中间数据,导致高内存占用。本文提出一种新的融合逐通道分块(FDT)方法用于DNN内存优化,与现有分块方法相比,其在不引入任何运行时开销的情况下降低内存使用。FDT比聚焦于卷积的现有分块方法适用于更多类型的网络层。它显著改进了TinyML内存优化:对以往无法优化的模型降低内存,并为使用现有方法时表现出高运行时开销的模型提供替代设计点。为确定最佳分块配置,提出了一种带新路径发现方法的端到端流程,以全自动方式应用FDT及现有分块方法,包括操作调度与内存中缓冲区的布局规划。在七个评估模型中,FDT对两个现有分块方法无法应用的模型分别实现76.2%和18.1%的显著内存缩减;另两个模型用现有方法时表现出显著运行时开销,而FDT提供了无开销但内存节省较少的替代设计点。
引用
@article{arxiv.2303.17878,
title = {Fused Depthwise Tiling for Memory Optimization in TinyML Deep Neural Network Inference},
author = {Rafael Stahl and Daniel Mueller-Gritschneder and Ulf Schlichtmann},
journal= {arXiv preprint arXiv:2303.17878},
year = {2023}
}
备注
Accepted as a full paper by the TinyML Research Symposium 2023