中文

为何FPGA-GPU异构性是基于嵌入式深度神经网络的最佳选择?

硬件体系结构 2021-02-03 v1

摘要

图形处理单元(GPUs)目前是深度学习(DL)加速器中占主导地位的可编程架构。然而,现场可编程门阵列(FPGAs)在DL加速器中的采用正获得势头。在本文中,我们证明了在嵌入式FPGA上直接硬件映射(DHM)卷积神经网络(CNN)在能效与执行时间方面大幅优于GPU实现。然而,DHM高度消耗资源,在实现最先进CNN时无法完全替代GPU。因此我们提出一种混合FPGA-GPU DL加速方法,并证明即使包含通信开销,异构加速仍优于GPU加速。实验结果在嵌入Nvidia(R) Jetson TX2 CPU-GPU板与Intel(R) Cyclone10GX FPGA板的异构多平台设置上进行。实验了SqueezeNet、MobileNetv2与ShuffleNetv2面向移动的CNN。我们表明,对于分类推理任务,异构FPGA-GPU加速在MobileNetv2(能耗降低12%-30%,延迟降低4%至26%)、SqueezeNet(能耗降低21%-28%,延迟相同)与ShuffleNetv2(能耗降低25%,延迟降低21%)上优于GPU加速。

关键词

引用

@article{arxiv.2102.01343,
  title  = {Why is FPGA-GPU Heterogeneity the Best Option for Embedded Deep Neural Networks?},
  author = {Walther Carballo-Hernández and Maxime Pelcat and François Berry},
  journal= {arXiv preprint arXiv:2102.01343},
  year   = {2021}
}

备注

Presented at DATE Friday Workshop on System-level Design Methods for Deep Learning on Heterogeneous Architectures (SLOHA 2021) (arXiv:2102.00818)