你只会多次存活:在真实崩溃-恢复场景中复用崩溃-停止算法的黑盒方案
分布式、并行与集群计算
2018-11-14 v1
摘要
基于分布式共识的算法通常在由 Chandra 和 Toueg 不可靠故障检测器增强的崩溃-停止异步模型中描述。在此类模型中,正确节点永远保持运行,不正确节点最终崩溃并永远停机,故障检测器最终永远正确行为。然而在现实中,节点以及通信链路都会崩溃并恢复,且无法确定性地保证永远处于某一状态。在本文中,我们在一个简单的新系统模型中刻画了这一现实的临时性与概率性行为。此外,我们识别出一类大型算法类,并为其设计了保持性质的变换。利用该变换,许多为异步崩溃-停止模型编写的算法可在真实系统中正确且未经修改地运行。
引用
@article{arxiv.1811.05007,
title = {You Only Live Multiple Times: A Blackbox Solution for Reusing Crash-Stop Algorithms In Realistic Crash-Recovery Settings},
author = {David Kozhaya and Ognjen Maric and Yvonne-Anne Pignolet},
journal= {arXiv preprint arXiv:1811.05007},
year = {2018}
}
备注
Published at OPODIS 2018