中文

位实用的深度神经网络计算

机器学习 2016-10-25 v1 人工智能 硬件体系结构 计算机视觉与模式识别

摘要

我们量化了在处理深度神经网络 (DNN) 卷积层乘法时的一种无效计算来源,并提出了 Pragmatic (PRA) 架构,该架构利用这一特性提高了性能和能效。这些无效计算的来源最好在传统乘法器的背景下理解,传统乘法器在内部生成多个项,即被乘数与 2 的幂的乘积,相加后产生最终乘积 [1]。在运行时,由于这些项是在被乘数与乘数的零位组合时生成的,因此许多项为零。虽然传统的位并行乘法器并行计算所有项以减少单个乘积的延迟,但 PRA 仅计算非零项,方法是:a) 将乘数表示即时转换为 2 的幂的显式列表,以及 b) 采用混合位并行被乘数/位串行乘数处理单元。PRA 利用了两种无效计算来源:1) 上述由于乘数表示缺乏显式性而导致的零乘积项,以及 2) 被乘数和乘数所使用的表示精度过剩,例如 [2]。测量结果表明,对于卷积层,PRA 的一个简单变体相比 DaDiaNao (DaDN) 加速器 [3] 性能提高了 2.6 倍,相比 STR [4] 提高了 1.4 倍。同样,与 DaDN 和 STR 相比,PRA 平均将能效分别提高了 28% 和 10%。改进的跨通道同步方案将相对于 DaDN 的性能提升boost至 3.1 倍。最后,即使采用 8 位量化表示 [5],Pragmatic 的优势依然存在。

关键词

引用

@article{arxiv.1610.06920,
  title  = {Bit-pragmatic Deep Neural Network Computing},
  author = {J. Albericio and P. Judd and A. Delmás and S. Sharify and A. Moshovos},
  journal= {arXiv preprint arXiv:1610.06920},
  year   = {2016}
}