DeCoILFNet:基于深度拼接与层间融合的卷积网络加速器
分布式、并行与集群计算
2019-01-10 v1
摘要
卷积神经网络(CNNs)在诸多领域迅速普及。由于其结构日益加深且计算繁重,难以将其部署于能量受限的移动应用。FPGA 等硬件加速器已成为一种有吸引力的替代方案。然而,受限于 FPGA 有限的片上内存与计算资源,满足高内存吞吐需求并挖掘 CNN 的并行性是一大挑战。我们提出了一种基于 FPGA 的高性能架构——基于深度拼接与层间融合的卷积网络加速器(DeCoILFNet),它通过跨深度展平来利用 CNN 的层内并行性,并将其与跨层高度流水化的数据流相结合以实现层间融合。该架构显著减少了片外内存访问并最大化吞吐率。与 3.5GHz 六核 Intel Xeon E7 caffe 实现相比,我们的 120MHz FPGA 加速器快 30 倍。此外,与最先进的 FPGA 加速器相比,我们的设计将外部内存访问减少 11.5 倍,且时钟周期数提速超过 2 倍。
引用
@article{arxiv.1901.02774,
title = {DeCoILFNet: Depth Concatenation and Inter-Layer Fusion based ConvNet Accelerator},
author = {Akanksha Baranwal and Ishan Bansal and Roopal Nahar and K. Madhava Krishna},
journal= {arXiv preprint arXiv:1901.02774},
year = {2019}
}