中文

Snowflake:面向深度卷积神经网络的模型无关加速器

硬件体系结构 2017-08-09 v1

摘要

深度卷积神经网络 (CNN) 是用于执行目标检测、分类、语义分割和自然语言处理任务的深度学习首选模型。CNN 需要数十亿次运算来处理一帧。这种计算复杂性与卷积运算固有的并行性相结合,使 CNN 成为定制加速器的极佳目标。然而,在针对不同的 CNN 层次结构和数据访问模式进行优化时,定制加速器很难实现接近 100% 的计算效率。在这项工作中,我们提出了 Snowflake,一种可扩展且高效的加速器,它对 CNN 工作负载是模型无关的,并且被设计为始终在接近峰值的硬件利用率下运行。Snowflake 能够在现代 CNN 模型上实现超过 91% 的计算效率。Snowflake 在 Xilinx Zynq XC7Z045 SoC 上实现,能够达到 128G-ops/s 的峰值吞吐量,并且在 AlexNet CNN 模型上实现了 100 帧每秒的测量吞吐量和 120 G-ops/s,在 GoogLeNet CNN 模型上实现了 36 帧每秒和 116G-ops/s,在 ResNet-50 CNN 模型上实现了 17 帧每秒和 122 G-ops/s。据我们所知,Snowflake 是唯一一个在现代 CNN 上实现超过 91% 效率的已实现系统,也是唯一一个将 GoogLeNet 和 ResNet 作为基准测试套件一部分的已实现系统。

关键词

引用

@article{arxiv.1708.02579,
  title  = {Snowflake: A Model Agnostic Accelerator for Deep Convolutional Neural Networks},
  author = {Vinayak Gokhale and Aliasger Zaidy and Andre Xian Ming Chang and Eugenio Culurciello},
  journal= {arXiv preprint arXiv:1708.02579},
  year   = {2017}
}