深度神经网络中基于结构化权重矩阵的硬件加速器:FPGA 与 ASIC
分布式、并行与集群计算
2018-05-01 v1 硬件体系结构
机器学习
神经与进化计算
摘要
工业界和学术界已对硬件加速进行了广泛研究。在本工作中,为应对计算能力和存储需求日益增长的挑战,我们提出了基于结构化权重矩阵(SWM)的压缩技术,适用于现场可编程逻辑门阵列(FPGA)和专用集成电路(ASIC)实现。在算法部分,基于 SWM 的框架采用块循环矩阵,以在精度和压缩率之间实现细粒度的权衡。基于 SWM 的技术可将每层在训练和推理阶段的计算复杂度从 O() 降至 O(),存储复杂度从 O() 降至 O()。对于深度卷积神经网络(DCNN)的 FPGA 实现,在 MNIST、SVHN 和 CIFAR-10 数据集上,在相同精度约束下,与 IBM TrueNorth 处理器基线相比,采用基于 SWM 的框架分别在性能和能效上取得了至少 152 倍和 72 倍的提升。对于长短期记忆(LSTM)网络的 FPGA 实现,与基线加速器相比,所提出的基于 SWM 的 LSTM 在性能上实现了高达 21 倍的提升,在能效上实现了 33.5 倍的增益。对于 ASIC 实现,基于 SWM 的 ASIC 设计在功耗、吞吐量和能效方面展现出显著优势。实验结果表明,该方法非常适合将 DNN 应用于 FPGA 和移动/物联网设备。
引用
@article{arxiv.1804.11239,
title = {Structured Weight Matrices-Based Hardware Accelerators in Deep Neural Networks: FPGAs and ASICs},
author = {Caiwen Ding and Ao Ren and Geng Yuan and Xiaolong Ma and Jiayu Li and Ning Liu and Bo Yuan and Yanzhi Wang},
journal= {arXiv preprint arXiv:1804.11239},
year = {2018}
}
备注
6 pages, 7 figures, GLSVLSI2018