一种在FPGA上高效实现反卷积神经网络的设计方法
机器学习
2017-05-09 v1 神经与进化计算
摘要
近年来深度学习算法在图像分类和语音识别等机器学习任务上表现出极高性能。为支持此类应用,已提出各种用于卷积神经网络(CNNs)的FPGA加速器架构,以比CPU和GPU处理器更低的功耗实现分类任务的高性能。然而迄今为止,关于FPGA实现反卷积神经网络(DCNNs)的研究很少。DCNNs也称为生成式CNNs,编码高维概率分布,已广泛用于场景补全、场景分割、图像创建、图像去噪和超分辨率成像等计算机视觉应用。我们提出了一种围绕加速器构建的用于反卷积网络的FPGA架构,该加速器有效处理执行步长反卷积所需的复杂内存访问模式,并且也支持卷积。我们还开发了三步设计优化方法,系统利用统计分析、设计空间探索和VLSI优化。为验证我们的FPGA反卷积加速器设计方法,我们使用生成对抗网络方法(GAN)在Tensorflow上离线在两个代表性数据集上训练DCNNs,然后将这些DCNNs映射到FPGA DCNN-plus-accelerator实现,在Xilinx Zynq-7000 FPGA上执行生成推理。我们的DCNN实现实现了0.012 GOPs/DSP的峰值性能密度。
引用
@article{arxiv.1705.02583,
title = {A Design Methodology for Efficient Implementation of Deconvolutional Neural Networks on an FPGA},
author = {Xinyu Zhang and Srinjoy Das and Ojash Neopane and Ken Kreutz-Delgado},
journal= {arXiv preprint arXiv:1705.02583},
year = {2017}
}