基于 Rapid 的大规模稳定且一致的成员关系管理
分布式、并行与集群计算
2018-03-12 v1
摘要
我们提出并评估了分布式成员关系服务 Rapid。Rapid 的核心是一种多进程割检测(cut detection, CD)方案,围绕两个关键见解展开:(i) 仅当来自多个来源的告警到达后才怀疑某进程发生故障;(ii) 当一组进程出现问题时,它检测整个组的故障,而非逐个对每进程下结论。实现这些见解转化为一种通信开销低的简单成员关系算法。我们提供的证据表明,即便出现复杂网络状况(如单向可达性问题、防火墙误配置及高丢包),该策略也足以在几乎处处驱动一致检测。此外,我们给出经验证据与分析,证明几乎处处检测以高概率发生。为完善设计,Rapid 包含一个无领导者共识协议,将多进程割检测转换为视图变更决策。所得成员关系服务既可在完全去中心化也可在逻辑集中模式下工作。我们给出了 Rapid 在中等规模云环境中的评估。Rapid 引导2000节点集群比 Memberlist 和 ZooKeeper 等主流工具快2–5.8倍,在复杂故障场景下保持稳定,并提供强一致性保证。将 Rapid 集成到现有分布式应用中十分容易,我们展示了两个此类应用。
引用
@article{arxiv.1803.03620,
title = {Stable and Consistent Membership at Scale with Rapid},
author = {Lalith Suresh and Dahlia Malkhi and Parikshit Gopalan and Ivan Porto Carreiro and Zeeshan Lokhandwala},
journal= {arXiv preprint arXiv:1803.03620},
year = {2018}
}
备注
15 pages