部分和在 DNN 加速器互连带宽与内存访问中的影响
硬件体系结构
2021-02-25 v1 机器学习
摘要
专用加速器正被设计用于应对深度神经网络(DNN)应用巨大的资源需求。功耗、性能与面积(PPA)约束限制了这些加速器中可用的 MAC 数量。需要大量 MAC 的卷积层常被划分为多个迭代子任务,这给互连与内存带宽等可用系统资源带来巨大压力。对这些子任务的特征图进行最优划分可大幅降低带宽需求。某些加速器通过实现本地存储器来避免片外或互连传输;然而,内存访问仍会执行,而降低的带宽有助于在此类架构中节省功耗。本文提出一种一阶解析方法,用于划分特征图以实现最优带宽,并评估该划分对带宽的影响。通过设计能够执行基本算术运算的主动内存控制器,可节省该带宽。结果表明,最优划分与主动内存控制器可实现高达 40% 的带宽降低。
引用
@article{arxiv.2011.00850,
title = {On the Impact of Partial Sums on Interconnect Bandwidth and Memory Accesses in a DNN Accelerator},
author = {Mahesh Chandra},
journal= {arXiv preprint arXiv:2011.00850},
year = {2021}
}