中文

Xilinx 与 Altera FPGA 中基于 OpenCL 的卷积神经网络加速器综合评估

计算机视觉与模式识别 2016-09-30 v1 分布式、并行与集群计算

摘要

深度学习显著推进了人工智能的前沿水平,在工业界和学术界广受欢迎。特别受关注的是卷积神经网络(CNN),其灵感来源于视觉皮层的层次结构,形成卷积运算的深层以及全连接分类器。这些深度 CNN 架构的硬件实现面临内存瓶颈的挑战,需要大量卷积层和全连接层,并行计算要求大量通信。基于多核 CPU 的解决方案已证明因内存墙和低并行度而不适用于此问题。众核 GPU 架构表现出优越的性能,但功耗高,且因缓存与主存之间的不一致性而存在内存限制。FPGA 设计方案也在积极探索中,其允许使用嵌入式 BlockRAM 实现内存层次结构。这促进了多个处理单元之间共享内存元素的并行使用,避免了数据复制和不一致性。这使得 FPGA 成为 CNN 实时分类的潜在强大解决方案。Altera 和 Xilinx 均已从 GPU 领域采纳 OpenCL 协同设计框架用于 FPGA 设计,作为一种伪自动开发方案。本文对用于 5 层深度 CNN 的 Altera 和 Xilinx OpenCL 框架进行了综合评估与比较。讨论了硬件资源、时序性能以及面向 CNN 的 OpenCL 架构。Xilinx 展现出更快的综合速度、更好的 FPGA 资源利用率和更紧凑的板卡。Altera 则提供多平台工具、成熟的开发者社区和更优的执行时间。

关键词

引用

@article{arxiv.1609.09296,
  title  = {Comprehensive Evaluation of OpenCL-based Convolutional Neural Network Accelerators in Xilinx and Altera FPGAs},
  author = {R. Tapiador and A. Rios-Navarro and A. Linares-Barranco and Minkyu Kim and Deepak Kadetotad and Jae-sun Seo},
  journal= {arXiv preprint arXiv:1609.09296},
  year   = {2016}
}

备注

6 pages, 6 figures. Robotic and Technology of Computers Lab report