可塑应用的检查点间隔确定
分布式、并行与集群计算
2017-11-02 v1
摘要
在存在系统故障的情况下,选择最优的应用检查点间隔对于最小化应用的运行时间至关重要。现有关于检查点间隔选择的工作大多针对顺序应用,少数涉及并行应用,且这些并行应用在整个执行期间使用相同数量的处理器。某些检查点系统支持并行应用,其执行所用处理器数量可在运行过程中改变。我们将此类并行应用称为可塑(malleable)应用。本文为可塑并行应用建立了一个性能模型,该模型将存在故障时可塑应用单位时间内有用工作量(UWT)估计为检查点间隔的函数。我们将该性能模型函数用于不同间隔,并选择使 UWT 值最大的间隔。通过在真实超级计算系统上获取的轨迹进行大量仿真,我们表明由本模型确定的检查点间隔能在故障存在时实现应用的高效率。
引用
@article{arxiv.1711.00270,
title = {Determination of Checkpointing Intervals for Malleable Applications},
author = {K. Raghavendra and Sathish S Vadhiyar},
journal= {arXiv preprint arXiv:1711.00270},
year = {2017}
}