中文

优化 CNN 卷积调度以实现高效内存访问

神经与进化计算 2019-02-06 v1

摘要

用于卷积网络的嵌入式推理引擎必须在内存带宽和缓冲大小上节俭,以满足功耗和成本约束。我们提出了一种针对具有应用管理缓冲的架构的循环嵌套优化的解析内存带宽模型。我们应用该模型优化 CNN 卷积循环嵌套。我们表明我们的模型比先前发表的模型更准确。使用该模型,我们可以在给定的严格本地缓冲约束下识别产生最低通信带宽的非平凡数据流调度。我们表明最优数据流调度可在实践中实现,且我们的模型相对于真实实现是准确的;此外,我们引入了一种称为硬件卷积块(HWC)的加速器架构,其实现了最优调度,并且我们表明与先前发表的具有类似内存接口但实现非最优调度的加速器相比,它实现了高达 14 倍的内存带宽降低。

关键词

引用

@article{arxiv.1902.01492,
  title  = {Optimally Scheduling CNN Convolutions for Efficient Memory Access},
  author = {Arthur Stoutchinin and Francesco Conti and Luca Benini},
  journal= {arXiv preprint arXiv:1902.01492},
  year   = {2019}
}