中文

PANTHER:利用高能效 ReRAM 的可编程神经网络训练架构

分布式、并行与集群计算 2019-12-30 v1 硬件体系结构 新兴技术 信号处理

摘要

深度神经网络的广泛采用伴随着由于训练代价高昂而不断增长的能量与性能需求。已提出众多专用架构来加速训练:包括数字架构以及使用阻变 RAM(ReRAM)交叉阵列的混合数字-模拟架构。基于 ReRAM 的加速器已证明 ReRAM 交叉阵列在执行训练盛行的矩阵-向量乘法操作上的有效性。然而,由于执行权重梯度与更新步骤时使用串行读写,它们仍效率低下。少数工作展示了在交叉阵列中执行外积的可能性,可用于实现权重梯度与更新步骤而无需串行读写。但这些工作局限于低精度操作,不足以应对典型训练负载。此外,它们仅局限于全连接层的有限训练算法集合。为克服这些局限,我们提出一种位切片技术以提升基于 ReRAM 的外积精度,这与仅用于矩阵-向量乘法的位切片有本质不同。我们将该技术纳入具有三种变体的交叉阵列架构,以适配不同训练算法。为在不同类型神经网络层(全连接、卷积等)与训练算法上评估我们的设计,我们开发了 PANTHER,一个带编译器支持的 ISA 可编程训练加速器。我们的评估显示,与数字加速器、基于 ReRAM 的加速器和 GPU 相比,PANTHER 分别实现了高达 8.02×8.02\times54.21×54.21\times103×103\times 的能耗降低,以及 7.16×7.16\times4.02×4.02\times16×16\times 的执行时间缩短。

关键词

引用

@article{arxiv.1912.11516,
  title  = {PANTHER: A Programmable Architecture for Neural Network Training Harnessing Energy-efficient ReRAM},
  author = {Aayush Ankit and Izzat El Hajj and Sai Rahul Chalamalasetti and Sapan Agarwal and Matthew Marinella and Martin Foltin and John Paul Strachan and Dejan Milojicic and Wen-mei Hwu and Kaushik Roy},
  journal= {arXiv preprint arXiv:1912.11516},
  year   = {2019}
}

备注

13 pages, 15 figures