中文

HyPar:面向深度学习加速器阵列的混合并行

分布式、并行与集群计算 2020-01-17 v2 机器学习

摘要

近年来随着人工智能的兴起,深度神经网络(DNNs)已被广泛应用于许多领域。为了实现高性能和能效,DNNs 的硬件加速(尤其是推理)在学术界和工业界都得到了深入研究。然而,我们仍面临两个挑战:大型 DNN 模型和数据集导致频繁的片外存储器访问;以及 DNNs 的训练,在最近的加速器设计中尚未被充分探索。为了真正为深度和大模型的训练提供高吞吐量和能效加速,我们不可避免地需要使用多个加速器来探索粗粒度并行性,而非大多数现有架构中所考虑的层内细粒度并行性。这提出了寻求加速器间最佳计算与数据流组织的关键研究问题。在本文中,受机器学习系统近期工作的启发,我们提出一种解决方案 HyPar,用以确定由 DNN 加速器阵列进行深度神经网络训练的逐层并行。HyPar 对特征图张量(输入和输出)、核张量、梯度张量和误差张量进行划分以供 DNN 加速器使用。一种划分构成了加权层并行方式的选择。优化目标是在训练完整 DNN 过程中搜索使总通信量最小的划分。为解决该问题,我们提出一种通信模型来解释通信的来源与数量。然后,我们使用分层逐层动态规划方法搜索每一层的划分。

关键词

引用

@article{arxiv.1901.02067,
  title  = {HyPar: Towards Hybrid Parallelism for Deep Learning Accelerator Array},
  author = {Linghao Song and Jiachen Mao and Youwei Zhuo and Xuehai Qian and Hai Li and Yiran Chen},
  journal= {arXiv preprint arXiv:1901.02067},
  year   = {2020}
}

备注

To appear in the 2019 25th International Symposium on High-Performance Computer Architecture (HPCA 2019)