NullHop:一种基于特征图稀疏表示的灵活卷积神经网络加速器
计算机视觉与模式识别
2020-10-27 v2 神经与进化计算
摘要
卷积神经网络 (CNN) 已成为解决许多最先进 (SOA) 视觉处理任务的主导神经网络架构。尽管图形处理器 (GPU) 最常用于训练和部署 CNN,但其在单帧运行时推理的能效低于 10 GOp/s/W。我们提出了一种名为 NullHop 的灵活高效的 CNN 加速器架构,该架构实现了适用于低功耗和低延迟应用场景的 SOA CNN。NullHop 利用 CNN 中神经元激活的稀疏性来加速计算并降低内存需求。这种灵活的架构允许在 1x1 到 7x7 的卷积核尺寸范围内高度利用可用计算资源。NullHop 可以在单次遍历中每层处理多达 128 个输入和 128 个输出特征图。我们在 Xilinx Zynq FPGA 平台上实现了所提出的架构,并展示了我们的实现如何减少从小型网络到广为人知的大型 VGG16 和 VGG19 CNN 等五种不同 CNN 中的外部存储器传输和计算时间。使用 Mentor Modelsim 在 28nm 工艺下以 500 MHz 时钟频率进行的综合后仿真表明,VGG19 网络实现了超过 450 GOp/s 的计算能力。通过利用稀疏性,NullHop 实现了 368% 的效率,保持了超过 98% 的 MAC 单元利用率,并在 6.3mm 的核心面积上实现了超过 3TOp/s/W 的能效。作为 NullHop 可用性的进一步证明,我们将其 FPGA 实现与神经形态事件相机相连,进行了实时交互演示。
引用
@article{arxiv.1706.01406,
title = {NullHop: A Flexible Convolutional Neural Network Accelerator Based on Sparse Representations of Feature Maps},
author = {Alessandro Aimar and Hesham Mostafa and Enrico Calabrese and Antonio Rios-Navarro and Ricardo Tapiador-Morales and Iulia-Alexandra Lungu and Moritz B. Milde and Federico Corradi and Alejandro Linares-Barranco and Shih-Chii Liu and Tobi Delbruck},
journal= {arXiv preprint arXiv:1706.01406},
year = {2020}
}