中文

采用相对索引压缩稀疏滤波器编码格式与堆叠滤波器静止流的3D-SIMD处理器架构用于深度神经网络的FPGA实现

计算机视觉与模式识别 2018-04-13 v3

摘要

在计算和内存密集的最先进(State-of-the-art)深度神经网络(DNN)部署于硬件资源与功耗预算受限的嵌入式系统是一项具有挑战性的任务。近期开发的如Deep Compression等技术使得如AlexNet和VGGNet等大型DNN可完全放入片上SRAM。但使用现有编码格式(如CSR或CSC)压缩的稀疏网络因其不规则的内存访问特性而使运行时计算复杂化。在[1]中,我们引入了计算数据流——堆叠滤波器静止数据流(SFS)——以及相应的数据编码格式——相对索引压缩稀疏滤波器格式(CSF)——以充分利用数据稀疏性并简化执行时的数据处理。本文中我们给出了这些方法的FPGA实现。我们实现了多个紧凑的流式全连接(FC)和卷积(CONV)神经网络处理器以展示其效率。与最先进结果[2,3,4]相比,我们的方法在大多数层上每PE的计算效率至少提升2倍。特别地,我们的方法在具有384个滤波器的AlexNet层CONV4上实现8倍提升,在具有512个滤波器的VGG16层CONV5-3上实现11倍提升。

关键词

引用

@article{arxiv.1803.10548,
  title  = {FPGA Implementations of 3D-SIMD Processor Architecture for Deep Neural Networks Using Relative Indexed Compressed Sparse Filter Encoding Format and Stacked Filters Stationary Flow},
  author = {Yuechao Gao and Nianhong Liu and Sheng Zhang},
  journal= {arXiv preprint arXiv:1803.10548},
  year   = {2018}
}