面向分布式存储系统的实时取证
分布式、并行与集群计算
2019-07-25 v1 机器学习
摘要
我们提出了 Kaleidoscope,这是一种支持对大规模分布式存储系统中由单个组件故障或资源争用问题引起的应用性能问题进行实时取证的创新系统。Kaleidoscope 的设计源于我们对一个匿名化为 PetaStore 的 PB 级存储系统中观察到的 I/O 故障的研究。Kaleidoscope 建立在三个关键特性之上:1)使用时空差分可观测性对 I/O 请求进行端到端性能监控;2)使用领域引导函数将存储组件的健康状况建模为随机过程,该函数考虑了路径冗余与测量中的不确定性;3)观察相似类型的健康与不健康组件在可靠性与性能指标上的差异,以归因最可能的根本原因。我们在 PetaStore 上部署了 Kaleidoscope,评估表明 Kaleidoscope 能够以 5 分钟为间隔运行实时取证,并精确定位 95.8% 的真实性能问题的根本原因,且监控开销可忽略不计。
引用
@article{arxiv.1907.10203,
title = {Live Forensics for Distributed Storage Systems},
author = {Saurabh Jha and Shengkun Cui and Tianyin Xu and Jeremy Enos and Mike Showerman and Mark Dalton and Zbigniew T. Kalbarczyk and William T. Kramer and Ravishankar K. Iyer},
journal= {arXiv preprint arXiv:1907.10203},
year = {2019}
}