中文

通过支持聚集操作提升基于NoC的CNN加速器性能

机器学习 2021-08-06 v1 硬件体系结构 性能

摘要

深度学习技术日益增长的应用驱动了对卷积神经网络(CNNs)高效并行计算架构的需求。设计多核CNN加速器时面临的一个重大挑战是处理处理单元之间的数据移动。CNN工作负载除了一对一和一对多流量外,还引入了许多对一流量。作为片上通信的事实标准,片上网络(NoC)可支持各种单播和多播流量。对于多对一流量,采用重复单播效率不高。本文提出在基于网格的NoC上使用聚集包,结合输出 stationary 脉动阵列以支持多对一流量。聚集包将从中间节点收集数据并最终高效地送达目的节点。使用由AlexNet和VGG-16卷积层生成的流量轨迹对该方法进行评估,结果表明其相比重复单播方法在延迟和功耗上均有改善。

关键词

引用

@article{arxiv.2108.02567,
  title  = {Improving the Performance of a NoC-based CNN Accelerator with Gather Support},
  author = {Binayak Tiwari and Mei Yang and Xiaohang Wang and Yingtao Jiang and Venkatesan Muthukumar},
  journal= {arXiv preprint arXiv:2108.02567},
  year   = {2021}
}

备注

Presented at 33rd IEEE International System-on-Chip Conference (SOCC)