中文

Breaking Band:高性能通信的分解分析

分布式、并行与集群计算 2020-02-10 v1

摘要

大规模系统上节点间通信的关键路径由多个组件构成。当超级计算应用使用诸如MPI_Send之类的高级通信例程发起消息传输时,消息的有效载荷会遍历多个软件栈、主机和目标节点上的I/O子系统,以及诸如交换机之类的网络组件。本文通过建模系统的整体注入开销和端到端延迟,分析了在通信关键路径上何处、为何以及花费了多少时间。我们将分析聚焦于小消息的性能,因为随着每节点核心数不断增长的趋势,细粒度通信正变得日益重要。该解析模型对节点间通信所花费的时间给出了准确而详细的分解。我们在基于Arm ThunderX2、通过Mellanox InfiniBand互联的服务器上验证了这些模型。这是此类工作在Arm上的首次开展。除分解外,我们描述了测量每个组件中耗时的方法,以便拥有精确CPU定时器和PCIe分析仪的读者能够测量其感兴趣系统上的分解。这样的分解对于软件开发人员、系统架构师和研究人员指导其优化工作至关重要。作为研究人员,我们利用该分解模拟了一系列针对当今高性能通信瓶颈的优化的影响并讨论了其可能性。

关键词

引用

@article{arxiv.2002.02563,
  title  = {Breaking Band: A Breakdown of High-performance Communication},
  author = {Rohit Zambre and Megan Grodowitz and Aparna Chandramowlishwaran and Pavel Shamis},
  journal= {arXiv preprint arXiv:2002.02563},
  year   = {2020}
}

备注

In Proceedings of the 48th ACM International Conference on Parallel Processing (ICPP), Kyoto, Japan, August 2019