中文

多GPU系统上Allgatherv的实证评估

分布式、并行与集群计算 2018-12-17 v1 性能

摘要

深度学习与大数据分析应用的计算和内存需求超出了单GPU的极限。然而,由于GPU间通信的复杂性,尤其对于具有不规则消息大小的集合通信,将应用有效扩展到多个GPU颇具挑战。本工作中,我们对多GPU系统上的Allgatherv例程进行性能评估,聚焦于GPU网络拓扑与所用通信库。我们给出OSU微基准测试结果,并以稀疏张量分解为案例研究,该应用使用具有高度不规则消息大小的Allgatherv。我们将现有张量分解工具扩展至不同节点数和每节点不同GPU数的系统上运行。随后,我们在三个不同系统上用一套真实数据集评估工具在使用传统MPI、CUDA-aware MVAPICH和NCCL时的通信性能:每节点1个GPU的16节点集群、含8个GPU的NVIDIA DGX-1以及含16个GPU的Cray CS-Storm。我们的结果表明,张量数据集中的不规则性产生了与OSU微基准测试相反的趋势,以及基准中不存在的趋势。

关键词

引用

@article{arxiv.1812.05964,
  title  = {An Empirical Evaluation of Allgatherv on Multi-GPU Systems},
  author = {Thomas B. Rolinger and Tyler A. Simon and Christopher D. Krieger},
  journal= {arXiv preprint arXiv:1812.05964},
  year   = {2018}
}

备注

2018 18th IEEE/ACM International Symposium on Cluster, Cloud and Grid Computing (CCGRID)