中文

swCaffe:一种在神威太湖之光上加速深度学习应用的并行框架

分布式、并行与集群计算 2019-03-19 v1 机器学习

摘要

本文报道了我们在 swCaffe 上的工作,这是一个在神威太湖之光上加速深度神经网络(DNNs)训练的高效并行框架。神威太湖之光是当前最快的超级计算机,采用独特的众核异构架构,由 40,960 个 SW26010 处理器通过定制通信网络互联。首先,我们指出了一些充分利用创新众核架构性能的深刻原则。其次,我们提出了一组基于 Caffe 重新设计多种神经网络层的优化策略。第三,我们提出了一种拓扑感知的参数同步方案,以将同步随机梯度下降(SGD)方法高效扩展到多个处理器。我们使用 ImageNet 数据集训练多种广泛使用的神经网络来评估我们的框架。在单节点上,与运行于 K40m GPU 上的 Caffe 相比,swCaffe 可达到 23%~119% 的整体性能。与 CPU 上的 Caffe 相比,swCaffe 在所有网络上运行快 3.04~7.84 倍。最后,我们展示了 swCaffe 在 1024 节点规模上训练 ResNet-50 和 AlexNet 的可扩展性。

关键词

引用

@article{arxiv.1903.06934,
  title  = {swCaffe: a Parallel Framework for Accelerating Deep Learning Applications on Sunway TaihuLight},
  author = {Jiarui Fang and Liandeng Li and Haohuan Fu and Jinlei Jiang and Wenlai Zhao and Conghui He and Xin You and Guangwen Yang},
  journal= {arXiv preprint arXiv:1903.06934},
  year   = {2019}
}

备注

10 pages