基于数据流分析的故障后高能效局部回滚
分布式、并行与集群计算
2018-06-06 v1
摘要
E 级系统将每小时遭遇故障。HPC 程序员主要依赖应用级检查点与全局回滚进行恢复。近年来,通过消息日志减少回滚进程数量的技术已实现。然而,基于日志的方法存在弱点,例如依赖对 MPI 实现内部的复杂修改,以及一般情况下可能需完全重启。为克服所有基于日志机制的局限,我们回归纯检查点机制,但主张数据流驱动恢复(DFR)——一种依赖迭代代码数据流分析与著名数据流图概念的全新方法。我们针对一个 MPI 模板代码展示 DFR 的有效性,在局部回滚期间将空闲节点上的整体能耗优化并降低 10–12%。我们还给出 DFR 相对全局回滚的大规模节能估算,对模板代码而言,其随进程数 n 以 n 平方增长。
引用
@article{arxiv.1806.01611,
title = {Energy-efficient localised rollback after failures via data flow analysis},
author = {Kiril Dichev and Kirk Cameron and Dimitrios Nikolopoulos},
journal= {arXiv preprint arXiv:1806.01611},
year = {2018}
}