中文

使用深度可分离卷积的 FPGA 上 CNN 加速器

信号处理 2018-09-10 v2 硬件体系结构

摘要

卷积神经网络(CNNs)因其高精度已广泛应用于计算机视觉与模式识别领域。然而,大型卷积运算计算密集,常需要如图形处理单元(GPU)般强大的计算平台。这使得 CNNs 难以应用于便携设备。最先进的 CNNs,如 MobileNetV2 与 Xception,采用深度可分离卷积替代标准卷积以适配嵌入式平台。这在精度仅有限损失的前提下显著减少了运算量与参数量。这种高度结构化的模型非常适于现场可编程门阵列(FPGA)实现。本文提出一种可扩展的高性能深度可分离卷积优化 CNN 加速器。该加速器可适配不同规模的 FPGA,只需在硬件资源与处理速度间取得平衡。作为示例,MobileNetV2 在 Arria 10 SoC FPGA 上实现,结果表明该加速器能以每幅 3.75 ms 对 ImageNet 中的图片分类,即约 266.6 帧每秒。相较 CPU 实现了 20 倍加速。

关键词

引用

@article{arxiv.1809.01536,
  title  = {A CNN Accelerator on FPGA Using Depthwise Separable Convolution},
  author = {Lin Bai and Yiming Zhao and Xinming Huang},
  journal= {arXiv preprint arXiv:1809.01536},
  year   = {2018}
}

备注

Accepted by IEEE Transaction on Circuits and Systems II: Express Briefs, Volume 65, Issue 10, Oct 2018