现代数据中心中内存、存储与网络故障的大规模研究
分布式、并行与集群计算
2019-01-14 v1 性能
摘要
大型互联网服务提供商(如 Amazon、Baidu、Facebook、Google 和 Microsoft)的现代数据中心所运行的工作负载支撑着数十亿用户,并横跨全球分布式基础设施。然而,现代数据中心中使用的设备会因多种原因发生故障,从故障部件到软件缺陷再到错误配置。故障设备使得大规模数据中心的运营充满挑战,因为现代数据中心中运行的工作负载由分布在众多服务器上的相互依赖的程序组成,因此隔离到单一设备的故障仍可能对工作负载产生广泛影响。在本学位论文中,我们测量并建模了大型互联网服务公司 Facebook 中的设备故障。我们聚焦于构成互联网服务数据中心基础设施基础的三种设备类型:用于主存的 DRAM、用于持久存储的 SSD,以及用于网络连接的交换机和骨干链路。对于每种设备类型,我们分析了按重要设备属性与运行条件(如使用年限、供应商和工作负载)细分的长期设备故障数据。我们还构建并发布了统计模型,以检验我们所分析设备的故障趋势。本学位论文的核心结论是,我们可以通过测量与建模深入理解设备为何发生故障以及如何预测其故障。我们希望本学位论文中呈现的分析、技术与模型能使学界更好地测量、理解并为未来面临的硬件可靠性挑战做好准备。
引用
@article{arxiv.1901.03401,
title = {Large Scale Studies of Memory, Storage, and Network Failures in a Modern Data Center},
author = {Justin Meza},
journal= {arXiv preprint arXiv:1901.03401},
year = {2019}
}
备注
PhD thesis, CMU (Dec 2018)