竞争优势:在资源受限的边缘计算应用中 FPGA 能否击败 GPU 实现 DCNN 推理加速?
分布式、并行与集群计算
2021-03-10 v2 硬件体系结构
图像与视频处理
信号处理
摘要
当作为生成模型训练时,深度学习算法在涉及高维数据的任务(如图像去噪与超分辨率)上表现出卓越性能。在一个由移动与边缘设备主导的日益互联的世界中,对这些算法在嵌入式平台上本地运行的需求激增。FPGA 凭借其可重编程性与低功耗特性,是这些边缘计算应用的理想候选。为此,我们设计了一种时空并行化硬件架构,能够加速一种为资源受限 FPGA 上高能效推理而优化的反卷积算法。我们提出将这种基于 FPGA 的加速器用于低功耗边缘计算应用中的反卷积神经网络(Deconvolutional Neural Network, DCNN)推理。为此,我们开发了系统性利用微架构创新、设计空间探索与统计分析的方法。使用 Xilinx PYNQ-Z2 FPGA,我们利用我们的架构加速了两个在 MNIST 与 CelebA 数据集上使用 Wasserstein GAN 框架训练的 DCNN 的推理。在这些网络上,与 NVIDIA Jetson TX1 边缘计算 GPU 相比,我们的 FPGA 设计实现了更高的吞吐功耗比以及更低的运行间差异。
引用
@article{arxiv.2102.00294,
title = {A Competitive Edge: Can FPGAs Beat GPUs at DCNN Inference Acceleration in Resource-Limited Edge Computing Applications?},
author = {Ian Colbert and Jake Daly and Ken Kreutz-Delgado and Srinjoy Das},
journal= {arXiv preprint arXiv:2102.00294},
year = {2021}
}