中文

部分和在 DNN 加速器互连带宽与内存访问中的影响

硬件体系结构 2021-02-25 v1 机器学习

摘要

专用加速器正被设计用于应对深度神经网络(DNN)应用巨大的资源需求。功耗、性能与面积(PPA)约束限制了这些加速器中可用的 MAC 数量。需要大量 MAC 的卷积层常被划分为多个迭代子任务,这给互连与内存带宽等可用系统资源带来巨大压力。对这些子任务的特征图进行最优划分可大幅降低带宽需求。某些加速器通过实现本地存储器来避免片外或互连传输;然而,内存访问仍会执行,而降低的带宽有助于在此类架构中节省功耗。本文提出一种一阶解析方法,用于划分特征图以实现最优带宽,并评估该划分对带宽的影响。通过设计能够执行基本算术运算的主动内存控制器,可节省该带宽。结果表明,最优划分与主动内存控制器可实现高达 40% 的带宽降低。

关键词

引用

@article{arxiv.2011.00850,
  title  = {On the Impact of Partial Sums on Interconnect Bandwidth and Memory Accesses in a DNN Accelerator},
  author = {Mahesh Chandra},
  journal= {arXiv preprint arXiv:2011.00850},
  year   = {2021}
}