中文

ReStore:用于容错算法中快速恢复的内存复制存储

分布式、并行与集群计算 2023-01-26 v3

摘要

容错分布式应用需要机制来恢复因进程故障而丢失的数据。在现代集群系统上,在此类故障后请求替换资源通常是不切实际的。因此,应用程序必须继续使用剩余的资源工作。这需要重新分配工作负载,并且未发生故障的进程需要重新加载数据。我们为MPI程序提出了一个算法框架及其C++库实现ReStore,该框架能够在进程故障后恢复数据。通过适当的数据分布和复制将所有必需的数据存储在内存中,恢复速度比依赖并行文件系统的标准检查点方案快得多。由于应用程序开发人员可以指定要加载哪些数据,我们还支持缩减恢复,而不是使用备用计算节点进行恢复。我们在受控的隔离环境和实际应用中评估了ReStore。我们的实验表明,在多达24,576个处理器上,丢失输入数据的加载时间在毫秒范围内,并且一个广泛使用的生物信息学应用的容错版本的恢复时间显著加快。

关键词

引用

@article{arxiv.2203.01107,
  title  = {ReStore: In-Memory REplicated STORagE for Rapid Recovery in Fault-Tolerant Algorithms},
  author = {Lukas Hübner and Demian Hespe and Peter Sanders and Alexandros Stamatakis},
  journal= {arXiv preprint arXiv:2203.01107},
  year   = {2023}
}