中文

利用空间加速器高效服务循环神经网络

分布式、并行与集群计算 2019-10-01 v1 机器学习 性能

摘要

循环神经网络(RNN)应用构成了人工智能驱动、低延迟数据中心工作负载的主要类别。大多数 RNN 加速执行模型将计算图拆解为 BLAS 核,导致显著的核间数据移动与资源利用不足。我们表明,通过支持更通用的循环构造以在加速器中捕获设计参数,可在不牺牲可编程性的前提下利用跨核优化提升资源利用率。该抽象层级启用了设计空间搜索,从而能在空间架构上跨多种问题规模高效利用片上资源。我们在该抽象上使用可配置空间加速器,通过 DeepBench 评估了优化策略。我们证明,与 Tesla V100 GPU 相比,该实现在性能上几何加速 30 倍、面积 1.6 倍、功耗效率 2 倍,与 Stratix 10 FPGA 上的 Microsoft Brainwave 实现相比几何加速 2 倍。

关键词

引用

@article{arxiv.1909.13654,
  title  = {Serving Recurrent Neural Networks Efficiently with a Spatial Accelerator},
  author = {Tian Zhao and Yaqi Zhang and Kunle Olukotun},
  journal= {arXiv preprint arXiv:1909.13654},
  year   = {2019}
}