一种面向 FPGA 上结构化稀疏卷积神经网络的高效硬件加速器
系统与控制
2020-01-08 v1 系统与控制
图像与视频处理
摘要
深度卷积神经网络(CNN)已在广泛应用范围内取得最先进的性能。然而,更复杂的 CNN 模型通常计算开销大,且被广泛需求于复杂人工智能(AI)任务。尽管近期关于网络压缩(如剪枝)的研究进展已成为减轻计算负担的有前景方向,但由于剪枝引起的不规则性,现有加速器仍无法充分利用利用稀疏性的优势。另一方面,现场可编程门阵列(FPGA)已被视为 CNN 推理加速的有前景硬件平台。然而,大多数现有 FPGA 加速器聚焦于稠密 CNN,无法解决不规则性问题。本文中,我们提出一种稀疏数据流,以跳过处理零权重的乘加(MAC)运算周期,并利用数据统计量通过零门控最小化能耗,从而避免不必要的计算。所提出的稀疏数据流带来了低带宽需求和高数据共享。随后我们设计了一个包含向量生成模块(VGM)的 FPGA 加速器,该模块可根据所提数据流匹配稀疏权重与输入激活之间的索引。实验结果表明,我们的实现在 Xilinx ZCU102 上针对 AlexNet 和 VGG-16 分别可实现 987 imag/s 和 48 imag/s 的性能,相较先前 CNN FPGA 加速器提供了 1.5 倍至 6.7 倍加速比以及 2.0 倍至 6.2 倍能效提升。
引用
@article{arxiv.2001.01955,
title = {An Efficient Hardware Accelerator for Structured Sparse Convolutional Neural Networks on FPGAs},
author = {Chaoyang Zhu and Kejie Huang and Shuyuan Yang and Ziqi Zhu and Hejia Zhang and Haibin Shen},
journal= {arXiv preprint arXiv:2001.01955},
year = {2020}
}