CATERPILLAR:加速深度神经网络训练的粗粒度可重构架构
分布式、并行与集群计算
2017-06-09 v2 机器学习
神经与进化计算
摘要
加速已训练深度神经网络(DNN)的推理是一个被广泛研究的课题。本文将焦点转向DNN的训练。训练阶段计算密集,要求复杂的数据通信,并包含多层次的数据依赖和并行性。本文对高效加速器进行了算法/架构空间探索,以实现更好的网络收敛速度和更高的训练DNN能效。我们进一步证明,一种对集合通信语义具有分层支持的架构,为训练执行随机和批量梯度下降技术的各种网络提供了灵活性。我们的结果表明,较小网络倾向于非批量技术,而较大网络使用批量操作时性能更高。在45nm技术下,CATERPILLAR在小型网络的SGD训练中实现了177 GFLOPS/W的性能效率和超过80%的利用率,在大型网络的流水线SGD/CP训练中实现了211 GFLOPS/W的性能效率和超过90%的利用率,分别使用103.2 mm和178.9 mm的总面积。
引用
@article{arxiv.1706.00517,
title = {CATERPILLAR: Coarse Grain Reconfigurable Architecture for Accelerating the Training of Deep Neural Networks},
author = {Yuanfang Li and Ardavan Pedram},
journal= {arXiv preprint arXiv:1706.00517},
year = {2017}
}
备注
ASAP 2017: The 28th Annual IEEE International Conference on Application-specific Systems, Architectures and Processors