通过支持聚集操作提升基于NoC的CNN加速器性能
机器学习
2021-08-06 v1 硬件体系结构
性能
摘要
深度学习技术日益增长的应用驱动了对卷积神经网络(CNNs)高效并行计算架构的需求。设计多核CNN加速器时面临的一个重大挑战是处理处理单元之间的数据移动。CNN工作负载除了一对一和一对多流量外,还引入了许多对一流量。作为片上通信的事实标准,片上网络(NoC)可支持各种单播和多播流量。对于多对一流量,采用重复单播效率不高。本文提出在基于网格的NoC上使用聚集包,结合输出 stationary 脉动阵列以支持多对一流量。聚集包将从中间节点收集数据并最终高效地送达目的节点。使用由AlexNet和VGG-16卷积层生成的流量轨迹对该方法进行评估,结果表明其相比重复单播方法在延迟和功耗上均有改善。
引用
@article{arxiv.2108.02567,
title = {Improving the Performance of a NoC-based CNN Accelerator with Gather Support},
author = {Binayak Tiwari and Mei Yang and Xiaohang Wang and Yingtao Jiang and Venkatesan Muthukumar},
journal= {arXiv preprint arXiv:2108.02567},
year = {2021}
}
备注
Presented at 33rd IEEE International System-on-Chip Conference (SOCC)