HEAL:无领袖分布式系统在不同持久性模型下的在线增量恢复
分布式、并行与集群计算
2026-02-10 v1
摘要
确保分布式系统的韧性已成为迫切关切。在当今环境下,迫切需要开发轻量级机制,快速且仅对 live 系统吞吐量产生小影响地恢复分布式系统。为此本文提出一种新的低开销、通用的现代非事务性无领袖分布式系统恢复方案,称为 HEAL。当节点发生故障时,HEAL 执行优化的在线增量恢复。本文介绍了在线性一致性和不同内存持久性模型下的 HEAL 的算法。我们在 6 节点 Intel 集群上实现了 HEAL。运行 TAOBench 工作负载的实验表明,HEAL 非常有效。HEAL 在平均 120 毫秒内恢复集群,而仅使运行工作负载的吞吐量降低 8.7%。相比,传统的无领袖系统恢复方案需要 360 秒恢复,使系统吞吐量降低 16.2%。最后,与面向有领袖系统的增量恢复方案相比,HEAL 将平均恢复延迟降低 20.7 倍,将吞吐量降低降低 62.4%。
引用
@article{arxiv.2602.08257,
title = {HEAL: Online Incremental Recovery for Leaderless Distributed Systems Across Persistency Models},
author = {Antonis Psistakis and Burak Ocalan and Fabien Chaix and Ramnatthan Alagappan and Josep Torrellas},
journal= {arXiv preprint arXiv:2602.08257},
year = {2026}
}