Arria 10上的OpenCL(TM)深度学习加速器
分布式、并行与集群计算
2017-01-16 v1 硬件体系结构
计算机视觉与模式识别
摘要
卷积神经网络(CNNs)已成为执行视觉任务(特别是图像分类领域)的实用手段。FPGA以能高效执行卷积而闻名,然而最近在FPGA上运行CNN的大部分努力相较于其他设备(如GPU)显示出有限的优势。由于FPGA器件上有限的外部存储器带宽,先前在FPGA上的方法常常受限于内存。我们展示了一种用OpenCL(TM)编写的新型架构,我们称之为深度学习加速器(DLA),它最大化数据重用并最小化外部存储器带宽。此外,我们展示了如何使用Winograd变换来显著提升FPGA的性能。结果,当在英特尔Arria 10器件上运行我们的DLA时,我们可以达到1020 img/s的性能,或在运行AlexNet CNN基准测试时达到23 img/s/W。这相当于1382 GFLOPs,并且比FPGA上的最先进技术快10倍,GFLOPS多8.4倍,效率高5.8倍。此外,23 img/s/W可与nVidia TitanX GPU上已知最佳的AlexNet公开实现相竞争。
引用
@article{arxiv.1701.03534,
title = {An OpenCL(TM) Deep Learning Accelerator on Arria 10},
author = {Utku Aydonat and Shane O'Connell and Davor Capalija and Andrew C. Ling and Gordon R. Chiu},
journal= {arXiv preprint arXiv:1701.03534},
year = {2017}
}
备注
To be published at FPGA 2017