中文

NeuroMAX:一种用于卷积神经网络的高吞吐、多线程、基于对数的加速器

硬件体系结构 2020-07-21 v1 机器学习

摘要

由于卷积神经网络(CNN)巨大的计算成本,其实时应用需要高吞吐量的硬件加速器。大多数传统 CNN 加速器依赖单核、线性处理单元(PE)结合一维数据流来加速卷积运算。这限制了每 PE 数量的峰值吞吐量与数量之比的最大可达值为 1。以往多数工作优化其数据流以接近 100% 的硬件利用率来达到该比值。本文中,我们引入一种高吞吐、多线程、基于对数的 PE 核。所设计的核在仅增加 6% 面积开销(与具有相同输出位精度的单个线性乘法器 PE 核相比)的情况下,使每 PE 数量的峰值吞吐量提高了 200%。我们还提出了一种二维权重广播数据流,利用 PE 核的多线程特性,在各种 CNN 中实现每层的高硬件利用率。我们所称的整个架构 NeuroMAX 在 Xilinx Zynq 7020 SoC 上以 200 MHz 处理时钟实现。我们对吞吐量、硬件利用率、面积与功耗分解以及延迟进行了详细分析,以展示相较先前 FPGA 和 ASIC 设计的性能提升。

关键词

引用

@article{arxiv.2007.09578,
  title  = {NeuroMAX: A High Throughput, Multi-Threaded, Log-Based Accelerator for Convolutional Neural Networks},
  author = {Mahmood Azhar Qureshi and Arslan Munir},
  journal= {arXiv preprint arXiv:2007.09578},
  year   = {2020}
}

备注

To be published in ICCAD 2020