Bit Fusion:用于加速深度神经网络的位级动态可组合架构
神经与进化计算
2018-05-31 v2 硬件体系结构
摘要
充分实现深度神经网络 (DNNs) 加速的潜力需要理解并利用算法特性。本文基于如下算法洞见:DNN 中运算的位宽可在不损害其分类精度的前提下降低。然而,为防止精度损失,位宽在不同 DNN 间差异显著,甚至可能对每一层进行调整。因此,固定位宽加速器要么为容纳最坏情况位宽需求而收益有限,要么导致最终精度下降。为缓解这些缺陷,本工作引入动态位级融合/分解作为 DNN 加速器设计中的新维度。我们通过设计 Bit Fusion(一种位灵活加速器)来探索该维度,其由位级处理单元阵列构成,可动态融合以匹配各 DNN 层的位宽。架构中的这种灵活性使得能以可能的最细粒度最小化计算与通信且不损失精度。我们使用八个真实前馈与循环 DNN 评估了 BitFusion 的益处。所提出的微架构用 Verilog 实现并基于 45 nm 工艺综合。利用综合结果与周期精确仿真,我们将 Bit Fusion 与两种最先进 DNN 加速器 Eyeriss 和 Stripes 的益处进行比较。在相同面积、频率和工艺技术下,BitFusion 相较 Eyeriss 提供 3.9 倍加速和 5.1 倍节能。与 Stripes 相比,当 BitFusion 的面积和频率设为与 Stripes 相同时,BitFusion 在 45 nm 节点提供 2.6 倍加速和 3.9 倍能耗降低。扩展到 16 nm 的 GPU 技术节点时,BitFusion 几乎匹配 250 瓦 Titan Xp(使用 8 位向量指令)的性能,而 BitFusion 仅消耗 895 毫瓦功率。
引用
@article{arxiv.1712.01507,
title = {Bit Fusion: Bit-Level Dynamically Composable Architecture for Accelerating Deep Neural Networks},
author = {Hardik Sharma and Jongse Park and Naveen Suda and Liangzhen Lai and Benson Chau and Joon Kyung Kim and Vikas Chandra and Hadi Esmaeilzadeh},
journal= {arXiv preprint arXiv:1712.01507},
year = {2018}
}