中文

对Allreduce的节点感知改进

分布式、并行与集群计算 2019-10-23 v1

摘要

\texttt{MPI\_Allreduce}集合操作是许多并行代码库的核心内核,特别是对于每个进程单一值的归约。常用的allreduce递归倍增算法获得了消息数的下界,基于与节点无关的性能模型在小的归约规模下达到最优。然而,该算法在节点集合间产生重复消息。MPICH中的节点感知优化通过使用每个节点一个主进程来消除重复消息,但在每个节点间步骤中产生大量非活跃进程。在本文中,我们提出一种算法,利用每个节点可用的多个进程来减少单个进程通信的节点间消息最大数,从而改善allreduce操作的性能,特别是对于小消息规模。

关键词

引用

@article{arxiv.1910.09650,
  title  = {Node-Aware Improvements to Allreduce},
  author = {Amanda Bienz and Luke N. Olson and William D. Gropp},
  journal= {arXiv preprint arXiv:1910.09650},
  year   = {2019}
}

备注

10 pages, 11 figures, ExaMPI Workshop at SC19