利用空间加速器高效服务循环神经网络
分布式、并行与集群计算
2019-10-01 v1 机器学习
性能
摘要
循环神经网络(RNN)应用构成了人工智能驱动、低延迟数据中心工作负载的主要类别。大多数 RNN 加速执行模型将计算图拆解为 BLAS 核,导致显著的核间数据移动与资源利用不足。我们表明,通过支持更通用的循环构造以在加速器中捕获设计参数,可在不牺牲可编程性的前提下利用跨核优化提升资源利用率。该抽象层级启用了设计空间搜索,从而能在空间架构上跨多种问题规模高效利用片上资源。我们在该抽象上使用可配置空间加速器,通过 DeepBench 评估了优化策略。我们证明,与 Tesla V100 GPU 相比,该实现在性能上几何加速 30 倍、面积 1.6 倍、功耗效率 2 倍,与 Stratix 10 FPGA 上的 Microsoft Brainwave 实现相比几何加速 2 倍。
引用
@article{arxiv.1909.13654,
title = {Serving Recurrent Neural Networks Efficiently with a Spatial Accelerator},
author = {Tian Zhao and Yaqi Zhang and Kunle Olukotun},
journal= {arXiv preprint arXiv:1909.13654},
year = {2019}
}