面向异构众核系统上深度卷积网络高效训练的片上通信网络
分布式、并行与集群计算
2017-12-07 v1
摘要
卷积神经网络(CNNs)已在包括计算机视觉、语音识别和自然语言处理在内的多种应用领域中展现出巨大成功。然而,随着数据集规模和神经网络架构深度的持续增长,设计用于训练 CNN 的高性能且高能效的计算硬件变得势在必行。在本文中,我们考虑设计基于专用 CPU-GPU 的异构众核系统以高能效训练 CNN 的问题。已有研究表明,传统基于 CPU-GPU 的异构众核平台所采用的典型片上通信基础设施无法高效处理 CPU 和 GPU 的通信需求。为解决此问题,我们首先分析了由训练两种深度 CNN 架构(即 LeNet 和 CDBNet)以执行图像分类所产生的计算过程的片上流量模式。利用该知识,我们设计了一种混合片上网络(NoC)架构,其由有线与无线链路组成,以改善运行上述 CNN 训练负载的基于 CPU-GPU 的异构众核平台的性能。与高度优化的有线网格 NoC 相比,所提出的 NoC 在训练 CNN 时实现了网络延迟 1.8 倍降低,并将网络吞吐量提高了 2.2 倍。对于所考虑的 CNN 负载,这些网络级改进转化为全系统能量延迟积(EDP)25% 的节省。这表明所提出的面向异构众核架构的混合 NoC 能够在保持高能效的同时显著加速 CNN 的训练。
引用
@article{arxiv.1712.02293,
title = {On-Chip Communication Network for Efficient Training of Deep Convolutional Networks on Heterogeneous Manycore Systems},
author = {Wonje Choi and Karthi Duraisamy and Ryan Gary Kim and Janardhan Rao Doppa and Partha Pratim Pande and Diana Marculescu and Radu Marculescu},
journal= {arXiv preprint arXiv:1712.02293},
year = {2017}
}
备注
Accepted in a future publication of IEEE Transactions on Computers