下一站“NoOps”:通过日志与指标的图式融合实现跨系统诊断
分布式、并行与集群计算
2018-09-21 v1 性能
摘要
在 IT 系统中执行诊断是一项日益复杂的任务,即便是最熟练的运维人员也无法在令人满意的时间内完成。系统及其架构会随业务和用户需求而非常快速地变化。许多组织看到了 NoOps(即无运维)维护与管理模型的价值。该模型的一种实现是由系统自动维护而无需任何人工干预。通往 NoOps 的路径不仅涉及精确快速的诊断,还涉及在系统被重新配置或变更后尽可能多地复用知识。最大的挑战是利用一个 IT 系统上的知识并复用于另一不同系统的诊断。我们提出了一种可转移知识并执行高质量 IT 系统诊断的加权图框架。我们将所有可能的数据编码为系统状态的图表示,并自动计算这些图的权重。然后,借助图之间的相似性评估,我们将关于故障的知识从一个系统转移到另一个系统并用于诊断。我们在 Spark、Hadoop、Kafka 和 Cassandra 系统上成功评估了所提出的方法。
引用
@article{arxiv.1809.07687,
title = {Next Stop "NoOps": Enabling Cross-System Diagnostics Through Graph-based Composition of Logs and Metrics},
author = {Michał Zasadziński and Marc Solé and Alvaro Brandon and Victor Muntés-Mulero and David Carrera},
journal= {arXiv preprint arXiv:1809.07687},
year = {2018}
}
备注
Peer-reviewed, accepted as a regular paper to IEEE Cluster 2018. To be published through proceedings in September 2018