中文

具有重试编排的可靠参与者模型

分布式、并行与集群计算 2022-11-15 v3 编程语言

摘要

云开发人员必须构建能够抵御故障和中断的应用程序。我们倡导一种基于参与者(actor)、重试编排和尾调用(tail call)的云容错编程模型。该模型构建于云上现成的持久化数据存储和消息队列之上。重试编排不仅保证(1)失败的参与者调用将被重试,而且保证(2)已完成的调用绝不会重复执行,以及(3)它在调用栈内跨故障保持严格的先于发生(happen-before)关系。尾调用可将复杂任务分解为简单步骤,以最小化恢复期间的重新执行。我们回顾了关键的应用模式和故障场景。我们形式化了一种进程演算(process calculus),以精确刻画该模型中容错机制。我们简要描述了我们的实现。使用一个受典型企业场景启发的应用,我们验证了实现的功能正确性,并评估了故障预备与恢复对性能的影响。

关键词

引用

@article{arxiv.2111.11562,
  title  = {Reliable Actors with Retry Orchestration},
  author = {Olivier Tardieu and David Grove and Gheorghe-Teodor Bercea and Paul Castro and Jaroslaw Cwiklik and Edward Epstein},
  journal= {arXiv preprint arXiv:2111.11562},
  year   = {2022}
}

备注

22 pages, 7 figures