EIE:压缩深度神经网络上的高效推理引擎
摘要
最先进的深度神经网络(DNNs)拥有数亿连接,并且在计算和内存上都是密集型的,难以部署在硬件资源和功耗预算有限的嵌入式系统上。虽然定制硬件有助于计算,但从 DRAM 读取权重比 ALU 操作贵两个数量级,并主导所需功耗。先前提出的“Deep Compression”使得大型 DNNs (AlexNet 和 VGGNet) 能够完全放入片上 SRAM 中。这种压缩通过剪枝冗余连接并让多个连接共享相同权重来实现。我们提出了一种高能效推理引擎(EIE),在该压缩网络模型上执行推理,并利用权重共享加速由此产生的稀疏矩阵-向量乘法。从 DRAM 转到 SRAM 为 EIE 节省 120 倍能耗;利用稀疏性节省 10 倍;权重共享给出 8 倍;跳过来自 ReLU 的零激活再节省 3 倍。在九个 DNN 基准上评估,与未压缩相同 DNN 的 CPU 和 GPU 实现相比,EIE 分别快 189 倍和 13 倍。EIE 具有直接处理压缩网络 102GOPS/s 的处理能力,对应于未压缩网络上的 3TOPS/s,并以仅 600mW 的功耗以 1.88x10^4 帧/秒处理 AlexNet 的 FC 层。它比 CPU 和 GPU 分别节能 24,000 倍和 3,400 倍。与 DaDianNao 相比,EIE 具有 2.9 倍、19 倍和 3 倍更好的吞吐量、能效和面积效率。
引用
@article{arxiv.1602.01528,
title = {EIE: Efficient Inference Engine on Compressed Deep Neural Network},
author = {Song Han and Xingyu Liu and Huizi Mao and Jing Pu and Ardavan Pedram and Mark A. Horowitz and William J. Dally},
journal= {arXiv preprint arXiv:1602.01528},
year = {2016}
}
备注
External Links: TheNextPlatform: http://goo.gl/f7qX0L ; O'Reilly: https://goo.gl/Id1HNT ; Hacker News: https://goo.gl/KM72SV ; Embedded-vision: http://goo.gl/joQNg8 ; Talk at NVIDIA GTC'16: http://goo.gl/6wJYvn ; Talk at Embedded Vision Summit: https://goo.gl/7abFNe ; Talk at Stanford University: https://goo.gl/6lwuer. Published as a conference paper in ISCA 2016