大型分布式存储系统中复制随机模型分析:平均场方法
分布式、并行与集群计算
2017-03-28 v2
摘要
分布式存储系统如Hadoop文件系统或Google文件系统(GFS)利用复制确保数据可用性与持久性。本文重点分析决定给定文件副本在某服务器上位置的复制机制的效率。针对若干策略,研究了网络节点负载的变异性。在真实系统实现背景下,通过模拟测试了三种复制机制:随机、最轻负载和选择幂次。模拟表明其中一些策略可能导致相当不平衡的状况:若为每节点平均副本数,则在平衡时节点负载可能表现出高变异性。本文显示,选择幂次类型算法的一个简单变体对节点负载有显著效果:在平衡时,节点负载分布具有有界支撑,大多数节点负载小于,这是这些系统存储空间设计的一个有趣性质。引入并研究了数学模型以解释这一有趣现象。这些系统的分析由于所涉及状态空间的高维性而相当复杂。我们的研究依赖概率方法、平均场分析,以分析当节点总数变大时网络任意节点的渐近行为。另一个要素是使用带标记泊松点过程的随机微积分来确立我们的一些结果。
引用
@article{arxiv.1701.00335,
title = {Analysis of a Stochastic Model of Replication in Large Distributed Storage Systems: A Mean-Field Approach},
author = {Wen Sun and Véronique Simon and Sébastien Monnet and Philippe Robert and Pierre Sens},
journal= {arXiv preprint arXiv:1701.00335},
year = {2017}
}