中文

基于性能剖析的大神经网络核外混合方法

机器学习 2019-07-12 v1 分布式、并行与集群计算 性能

摘要

GPU 被广泛用于加速基于神经网络(NNs)的深度学习。另一方面,由于 GPU 内存容量有限,难以实现在 GPU 上计算大型神经网络的高效程序。为了计算超出 GPU 内存容量的神经网络,已有工作提出了数据交换方法和重计算方法。然而,这些方法中,由于数据移动或计算量增加会产生性能开销。为了减少开销,考虑各层的特征(如尺寸和重计算代价)十分重要。基于这一思路,我们提出了基于性能剖析的核外混合方法(PoocH)。PoocH 基于运行时性能剖析来确定交换或重计算的目标层。我们通过扩展深度学习框架 Chainer 实现了 PoocH,并评估了其性能。借助 PoocH,我们成功在单块 16 GB 内存的 GPU 上计算了需要 50 GB 内存的神经网络。与核内情况相比,在 x86 机器上性能下降为 38%,在 POWER9 机器上为 28%。

关键词

引用

@article{arxiv.1907.05013,
  title  = {Profiling based Out-of-core Hybrid Method for Large Neural Networks},
  author = {Yuki Ito and Haruki Imai and Tung Le Duc and Yasushi Negishi and Kiyokuni Kawachiya and Ryo Matsumiya and Toshio Endo},
  journal= {arXiv preprint arXiv:1907.05013},
  year   = {2019}
}

备注

15 pages