中文

深度神经网络中基于结构化权重矩阵的硬件加速器:FPGA 与 ASIC

分布式、并行与集群计算 2018-05-01 v1 硬件体系结构 机器学习 神经与进化计算

摘要

工业界和学术界已对硬件加速进行了广泛研究。在本工作中,为应对计算能力和存储需求日益增长的挑战,我们提出了基于结构化权重矩阵(SWM)的压缩技术,适用于现场可编程逻辑门阵列(FPGA)和专用集成电路(ASIC)实现。在算法部分,基于 SWM 的框架采用块循环矩阵,以在精度和压缩率之间实现细粒度的权衡。基于 SWM 的技术可将每层在训练和推理阶段的计算复杂度从 O(n2n^2) 降至 O(nlognn\log n),存储复杂度从 O(n2n^2) 降至 O(nn)。对于深度卷积神经网络(DCNN)的 FPGA 实现,在 MNIST、SVHN 和 CIFAR-10 数据集上,在相同精度约束下,与 IBM TrueNorth 处理器基线相比,采用基于 SWM 的框架分别在性能和能效上取得了至少 152 倍和 72 倍的提升。对于长短期记忆(LSTM)网络的 FPGA 实现,与基线加速器相比,所提出的基于 SWM 的 LSTM 在性能上实现了高达 21 倍的提升,在能效上实现了 33.5 倍的增益。对于 ASIC 实现,基于 SWM 的 ASIC 设计在功耗、吞吐量和能效方面展现出显著优势。实验结果表明,该方法非常适合将 DNN 应用于 FPGA 和移动/物联网设备。

关键词

引用

@article{arxiv.1804.11239,
  title  = {Structured Weight Matrices-Based Hardware Accelerators in Deep Neural Networks: FPGAs and ASICs},
  author = {Caiwen Ding and Ao Ren and Geng Yuan and Xiaolong Ma and Jiayu Li and Ning Liu and Bo Yuan and Yanzhi Wang},
  journal= {arXiv preprint arXiv:1804.11239},
  year   = {2018}
}

备注

6 pages, 7 figures, GLSVLSI2018