中文

NEURAghe:利用 CPU-FPGA 协同在 Zynq SoC 上实现高效灵活的 CNN 推理加速

神经与进化计算 2019-11-28 v1 硬件体系结构 分布式、并行与集群计算

摘要

深度卷积神经网络(CNN)在需要类人数据理解能力的任务(如图像或语音识别)中取得了优异的结果。然而,其计算负载相当可观,这推动了 CNN 专用加速器的发展。本工作提出 NEURAghe,一种用于在 Zynq SoC 上加速 CNN 的灵活高效软硬件协同方案。NEURAghe 协同利用 Zynq ARM 核与部署在可重构逻辑上的强大且灵活的卷积专用处理器(Convolution-Specific Processor)。该卷积专用处理器内嵌卷积引擎与可编程软核,将 ARM 处理器从大部分监管任务中解放出来,并允许软件以极细粒度控制加速器。该方法论开启了协同异构计算之路:当加速器处理 CNN 主要工作负载时,ARM 核可无缝执行计算图中难以加速的部分,并利用 NEON 向量引擎进一步加速计算。通过配套的 NeuDNN 软件栈,NEURAghe 支持端到端基于 CNN 的分类,峰值性能达 169 Gops/s,能效为 17 Gops/W。得益于我们的异构计算模型,我们的平台优于现有最优水平,在 VGG-16 端到端执行上达到 5.5 fps 帧率,在 ResNet-18 上达到 6.6 fps。

关键词

引用

@article{arxiv.1712.00994,
  title  = {NEURAghe: Exploiting CPU-FPGA Synergies for Efficient and Flexible CNN Inference Acceleration on Zynq SoCs},
  author = {Paolo Meloni and Alessandro Capotondi and Gianfranco Deriu and Michele Brian and Francesco Conti and Davide Rossi and Luigi Raffo and Luca Benini},
  journal= {arXiv preprint arXiv:1712.00994},
  year   = {2019}
}

备注

22 pages, 14 figures, submitted to ACM Transactions on Reconfigurable Technology and Systems