使用阻性交叉点器件加速深度神经网络训练
机器学习
2017-05-24 v1 神经与进化计算
机器学习
摘要
近年来,深度神经网络(DNN)在语音识别、视觉目标检测、模式提取等大规模分析与分类任务中展现出重大商业影响。然而,大型DNN的训练普遍被认为是耗时且计算密集的任务,需要数据中心规模的计算资源投入多日。这里我们提出阻性处理单元(RPU)器件的概念,其有可能将DNN训练加速几个数量级,同时功耗低得多。所提出的RPU器件可以在本地存储和更新权重值,从而最小化训练期间的数据移动,并允许充分利用训练算法的局部性和并行性。我们确定了在现实兼容CMOS技术中实现用于DNN训练的加速器芯片的RPU器件和系统规格。对于具有约10亿权重的大型DNN,这种大规模并行RPU架构相比最先进微处理器可实现30,000倍的加速,同时提供84,000 GigaOps/s/W的功率效率。当前需要数千台机器组成的数据中心规模集群训练数天的问题,可在单个RPU加速器上数小时内解决。由RPU加速器集群组成的系统将能够处理具有数万亿参数的大数据问题,这是当今不可能解决的,例如所有世界语言间的自然语言识别与翻译、大规模商业和科学数据流实时分析、来自大量物联网(IoT)传感器的多模态感官数据流集成与分析。
引用
@article{arxiv.1603.07341,
title = {Acceleration of Deep Neural Network Training with Resistive Cross-Point Devices},
author = {Tayfun Gokmen and Yurii Vlasov},
journal= {arXiv preprint arXiv:1603.07341},
year = {2017}
}
备注
19 pages, 5 figures, 2 tables