中文

SMAUG:面向深度学习工作负载的端到端全栈仿真基础设施

机器学习 2019-12-12 v2 分布式、并行与集群计算

摘要

近年来,深度神经网络的硬件加速取得了巨大进展。然而,大多数研究集中于优化加速器微体系结构以在逐层基础上获得更高性能与能效。我们发现,对于整体单批次推理延迟,加速器仅占 25-40%,其余耗费在数据搬移与深度学习软件框架中。迄今为止,在早期设计阶段(RTL 可用之前)研究端到端 DNN 性能非常困难,因为现有 DNN 框架均不支持带易定制硬件加速器集成的端到端仿真。为弥补该研究基础设施的缺口,我们提出 SMAUG,首个专为端到端深度学习应用仿真而构建的 DNN 框架。SMAUG 为研究人员提供了评估 DNN 工作负载的广泛能力,从多样化网络拓扑到简易加速器建模与 SoC 集成。为展示 SMAUG 的能力与价值,我们给出案例研究,说明如何在不改变任何加速器微体系结构部分的情况下优化整体性能与能效,实现相较基线系统最高 1.8-5 倍加速,并展示 SMAUG 如何为摄像头供电的深度学习流水线调优 SoC。

关键词

引用

@article{arxiv.1912.04481,
  title  = {SMAUG: End-to-End Full-Stack Simulation Infrastructure for Deep Learning Workloads},
  author = {Sam Likun Xi and Yuan Yao and Kshitij Bhardwaj and Paul Whatmough and Gu-Yeon Wei and David Brooks},
  journal= {arXiv preprint arXiv:1912.04481},
  year   = {2019}
}

备注

14 pages, 20 figures