Falkirk Wheel:数据流系统的回滚恢复
分布式、并行与集群计算
2015-04-01 v1
摘要
我们提出了一种用于分布式数据流系统中回滚恢复的新模型。我们通过为每个事件(如消息传递)分配逻辑时间来解释现有的回滚方案。如果在执行期间某些处理器发生故障,系统将通过为每个处理器选择一组逻辑时间来回滚。该集合内时间点上事件的效果被保留或从保存的状态恢复,而其他事件的效果被撤销并重新执行。我们表明,通过在不同处理器上采用不同的逻辑时间“域”,应用程序可以针对其计算的不同部分采用适当的检查点方案。我们结合一个将批处理与低延迟流更新相结合的应用实例进行说明。我们展示了用于在使用多逻辑时间域的系统中确定回滚的全局一致状态的规则和算法。我们还引入了处理器上的选择性回滚,其可以有选择地保留某些逻辑时间点上事件的效果而非其他事件的效果,且独立于这些事件的原始执行顺序。选择性回滚允许新的检查点策略,其特别适用于迭代流算法。我们报告了在 Naiad 系统背景下我们新框架的实现。
引用
@article{arxiv.1503.08877,
title = {Falkirk Wheel: Rollback Recovery for Dataflow Systems},
author = {Michael Isard and Martín Abadi},
journal= {arXiv preprint arXiv:1503.08877},
year = {2015}
}
备注
DRAFT work in progress