多GPU系统上Allgatherv的实证评估
分布式、并行与集群计算
2018-12-17 v1 性能
摘要
深度学习与大数据分析应用的计算和内存需求超出了单GPU的极限。然而,由于GPU间通信的复杂性,尤其对于具有不规则消息大小的集合通信,将应用有效扩展到多个GPU颇具挑战。本工作中,我们对多GPU系统上的Allgatherv例程进行性能评估,聚焦于GPU网络拓扑与所用通信库。我们给出OSU微基准测试结果,并以稀疏张量分解为案例研究,该应用使用具有高度不规则消息大小的Allgatherv。我们将现有张量分解工具扩展至不同节点数和每节点不同GPU数的系统上运行。随后,我们在三个不同系统上用一套真实数据集评估工具在使用传统MPI、CUDA-aware MVAPICH和NCCL时的通信性能:每节点1个GPU的16节点集群、含8个GPU的NVIDIA DGX-1以及含16个GPU的Cray CS-Storm。我们的结果表明,张量数据集中的不规则性产生了与OSU微基准测试相反的趋势,以及基准中不存在的趋势。
引用
@article{arxiv.1812.05964,
title = {An Empirical Evaluation of Allgatherv on Multi-GPU Systems},
author = {Thomas B. Rolinger and Tyler A. Simon and Christopher D. Krieger},
journal= {arXiv preprint arXiv:1812.05964},
year = {2018}
}
备注
2018 18th IEEE/ACM International Symposium on Cluster, Cloud and Grid Computing (CCGRID)