中文

TMA:基于无乘法器大规模并行处理器的 Tera-MACs/W 神经硬件推理加速器

分布式、并行与集群计算 2019-09-11 v1 硬件体系结构 信号处理

摘要

深度神经网络中计算密集的推理任务推动了新加速器架构的变革,以降低功耗与延迟。硬件推理加速器的关键性能指标是每瓦乘法累加操作数(MACs/W),其中,当前最先进的 MACs/W 仍为数百 Giga-MACs/W。我们提出了一种 Tera-MACS/W 神经硬件推理加速器(TMA),其具有 8 位激活值和小于 1 字节的可扩展整数权重。该架构的主要特征是用于矩阵-向量运算的可配置神经处理单元。所提出的神经处理单元具有无乘法器大规模并行处理器,可在无任何乘法的情况下工作,这使其对高能效高性能神经网络应用颇具吸引力。我们使用在 ImageNet 上训练的 Alexnet 对系统的延迟、功耗和性能进行基准测试。最后,我们将该加速器的吞吐量与功耗与先前工作进行了比较。所提出的加速器在能效和面积方面优于当前最先进水平,在 1.0 V、65 nm CMOS 工艺下实现了 2.3 TMACS/W。

关键词

引用

@article{arxiv.1909.04551,
  title  = {TMA: Tera-MACs/W Neural Hardware Inference Accelerator with a Multiplier-less Massive Parallel Processor},
  author = {Hyunbin Park and Dohyun Kim and Shiho Kim},
  journal= {arXiv preprint arXiv:1909.04551},
  year   = {2019}
}

备注

8 pages, 10 figures