中文

Reinit++:评估面向 MPI 容错的全局重启恢复方法性能

分布式、并行与集群计算 2021-02-16 v1

摘要

随着超级计算机规模扩大,硬件组件数量增加导致故障率上升。在标准实践中,应用通过检查点保存数据,并在故障发生后重启执行以从最新检查点恢复。然而,重新部署应用会因拆除与重建执行而产生开销,并可能限制从缓慢的永久存储中检索检查点。本文提出 Reinit++,一种避免应用重新部署的全局重启恢复 Reinit 方法的全新设计与实现。我们广泛评估了 Reinit++ 与主流 MPI 容错方法 ULFM(实现全局重启恢复)以及典型的应用重启实践,以获得关于性能的新见解。对三个不同的 HPC 代理应用进行实验,使其具备抵御进程与节点故障的弹性,结果表明 Reinit++ 的恢复速度远快于重启(最高 6 倍)或 ULFM(最高 3 倍),并且随着 MPI 进程数量增长具有极佳的可扩展性。

关键词

引用

@article{arxiv.2102.06896,
  title  = {Reinit++: Evaluating the Performance of Global-Restart Recovery Methods For MPI Fault Tolerance},
  author = {Giorgis Georgakoudis and Luanzheng Guo and Ignacio Laguna},
  journal= {arXiv preprint arXiv:2102.06896},
  year   = {2021}
}

备注

International Conference on High Performance Computing (ISC 2020)