中文

用于深度卷积神经网络硬件加速的堆叠滤波器静态流

计算机视觉与模式识别 2018-02-07 v3

摘要

为解决面向硬件加速的深度卷积神经网络(CNNs)在存储和计算资源上的限制,我们提出了一种计算流——堆叠滤波器静态流(SFS),以及相应的数据编码格式——相对索引压缩稀疏滤波器格式(CSF),以充分利用数据稀疏性,并简化执行时的数据处理。我们还提出了一种三维单指令多数据(3D-SIMD)处理器架构,用以说明如何利用 SFS 流和 CSF 格式加速深度 CNNs。与最先进的结果(Han et al., 2016b)相比,我们的方法在降低 AlexNet 所需存储上实现了 1.11 倍提升,在降低 SqueezeNet 所需存储上实现了 1.09 倍提升,且在 ImageNet 数据集上精度无损。此外,使用这些方法可节省用于处理不规则稀疏数据访问的逻辑芯片面积。与 DVAS、ENVISION 等中的 2D-SIMD 处理器结构相比,我们的方法在来自 Deep Compression 的 AlexNet 数据上实现了约 3.65 倍的处理单元(PE)阵列利用率提升(从 26.4\% 到 96.5\%)。

关键词

引用

@article{arxiv.1801.07459,
  title  = {Stacked Filters Stationary Flow For Hardware-Oriented Acceleration Of Deep Convolutional Neural Networks},
  author = {Yuechao Gao and Nianhong Liu and Sheng Zhang},
  journal= {arXiv preprint arXiv:1801.07459},
  year   = {2018}
}