重启与检查点的渐近效率
概率论
2018-05-15 v2 性能
摘要
许多任务在完成前会发生失败。重启与检查点是两种最常见的失败恢复策略。在重启下,一旦发生失败,任务即从开头重新执行。在检查点下,失败后任务从先前检查点恢复。我们研究无限任务序列(其规模构成平稳序列)下重启的渐近效率。我们将渐近效率定义为无失败时总完成时间与时发生失败时的总完成时间之比的极限。渐近效率是否为正取决于任务规模分布与支配失败的随机变量之尾部的比较。我们的框架允许失败率的变化及任务规模间的依赖性。我们还研究了当任务几乎必然无限且检查点间隔为独立同分布时检查点的类似渐近效率概念。此外,在检查点中,当失败为指数分布时,我们证明存在无限通用检查点序列,只要系统从位于它们之前的任一检查点启动便始终被使用。
引用
@article{arxiv.1802.07455,
title = {Asymptotic efficiency of restart and checkpointing},
author = {Antonio Sodre},
journal= {arXiv preprint arXiv:1802.07455},
year = {2018}
}
备注
Theorem 2 is slightly restated and its proof in the appendix is fixed