中文

在标度极限下具有最优多层预条件子的全隐式 Runge-Kutta 阶段并行实现

数值分析 2022-09-15 v1 数值分析

摘要

我们给出了一种用于 Radau IIA 型全隐式 Runge–Kutta 方法的全阶段并行预条件器的实现,该预条件器用 LU 分解得到的下三角矩阵逼近 Butcher 表中 AQA_Q 的逆,并将系统对角化为与阶段数同样多的块。对于变换后的系统,我们采用块预条件器,其中每个块被分布并由一组进程并行求解。对于部分结果的组合,我们要么使用类似 Cannon 算法的通信模式,要么使用共享内存。一个性能模型以及针对含时热问题使用无矩阵有限元方法开展的大量性能研究(包括在 3k 计算节点上多达 150k 进程的强标度运行)表明,当块求解器以较低并行效率运行(这发生在标度极限附近)时,阶段并行实现可达到更高吞吐量。可获得的加速比随阶段数线性增加,并以阶段数为上界。此外,我们展示了所提出的阶段并行概念也适用于 AQA_Q 被直接对角化的情况,这需要复数运算或求解二阶块并使算法的部分过程串行化。作为将阶段分布并分配给不同进程的替代方案,我们讨论了将来自不同阶段的操作批量组合在一起的可能性。

关键词

引用

@article{arxiv.2209.06700,
  title  = {Stage-parallel fully implicit Runge-Kutta implementations with optimal multilevel preconditioners at the scaling limit},
  author = {Peter Munch and Ivo Dravins and Martin Kronbichler and Maya Neytcheva},
  journal= {arXiv preprint arXiv:2209.06700},
  year   = {2022}
}