在 GPU 上评估抽象异步 Schwarz 求解器
分布式、并行与集群计算
2020-05-06 v2 数学软件
摘要
随着百亿亿次计算时代的到来,我们认识到大多数领先超级计算机都是异构且大规模并行的,即便在单节点上也具有多个协处理器(如 GPU)和每节点多核。例如,ORNL 的 Summit 在每个节点上集成了六块 NVIDIA Tesla V100 和 42 核 IBM Power9。在单节点内甚至跨多节点同步所有计算资源代价极高。因此有必要开发和研究异步算法,以规避这种面向大规模并行的 bulk-synchronous 计算问题。在本研究中,我们考察抽象限制加性 Schwarz 方法的异步版本作为求解器,其中我们不进行显式同步,而是允许子域间数据通信完全异步,从而消除算法的 bulk synchronous 特性。我们通过使用 MPI 标准的一端 RMA 函数实现这一点。我们研究了在多核架构和多个 GPU 上此类异步求解器相对于其同步对应物的优势。我们还研究了通信模式与局部求解器及其对全局求解器的影响。最后,我们展示了该概念相比同步对应物可带来可观的运行时间收益。
引用
@article{arxiv.2003.05361,
title = {Evaluating Abstract Asynchronous Schwarz solvers on GPUs},
author = {Pratik Nayak and Terry Cojean and Hartwig Anzt},
journal= {arXiv preprint arXiv:2003.05361},
year = {2020}
}
备注
Preprint submitted to IJHPCA