一种用于大规模内存中数据集上深度神经网络训练的可扩展近内存架构
分布式、并行与集群计算
2018-10-18 v4 硬件体系结构
摘要
大多数针对深度神经网络的近内存硬件加速器研究主要聚焦于推理,而加速训练方面的潜力迄今相对较少受到关注。基于对最先进的基于梯度的训练方法中关键计算模式的深入分析,我们提出了一种称为NTX的高效近内存加速引擎,可用于大规模训练最先进的深度卷积神经网络。我们的主要贡献是:(i) RISC-V核心与NTX协处理器的松耦合,将卸载开销较已发表结果降低7倍;(ii) 优化的符合IEEE754标准的数据通路,用于快速高精度卷积与梯度传播;(iii) 将NTX嵌入混合内存立方体(Hybrid Memory Cube)逻辑基片剩余区域中的近内存计算评估;以及(iv) 数据中心场景下HMC网格的扩展分析。我们展示了NTX相较当代GPU在少4.4倍硅面积下实现2.7倍的能效提升,以及以全浮点精度训练大型最先进网络时1.2 Tflop/s的计算性能。在数据中心规模下,NTX网格实现了 above 95%的并行与能效,同时相较基于GPU的系统提供2.1倍节能或3.1倍性能提升。
引用
@article{arxiv.1803.04783,
title = {A Scalable Near-Memory Architecture for Training Deep Neural Networks on Large In-Memory Datasets},
author = {Fabian Schuiki and Michael Schaffner and Frank K. Gürkaynak and Luca Benini},
journal= {arXiv preprint arXiv:1803.04783},
year = {2018}
}
备注
14 pages, submitted to IEEE Transactions on Computers journal