中文

面向大规模在线服务系统的基于图的故障聚合

机器学习 2021-08-30 v1 软件工程

摘要

随着在线服务系统在复杂性与规模上的持续增长,故障事件的管理方式将显著影响公司营收与用户信任。由于级联效应,云故障往往伴随来自依赖服务与设备的海量故障事件。为追求高效的故障管理,应将相关事件快速聚合以缩小问题范围。为此,本文提出 GRLIA,一种基于云故障级联图上的图表示学习的故障聚合框架。以一种无监督且统一的方式为每类独特故障学习一个表示向量,该向量能够同时编码事件间的拓扑与时间相关性。因此,它可轻松用于在线故障聚合。特别地,为更准确地学习相关性,我们尝试利用细粒度系统监测数据即关键性能指标(KPIs)来恢复故障级联影响的完整范围。所提框架使用从华为云大规模在线服务系统收集的真实故障事件数据进行评估。实验结果证明 GRLIA 有效且优于现有方法。此外,我们的框架已成功部署于工业实践中。

关键词

引用

@article{arxiv.2108.12179,
  title  = {Graph-based Incident Aggregation for Large-Scale Online Service Systems},
  author = {Zhuangbin Chen and Jinyang Liu and Yuxin Su and Hongyu Zhang and Xuemin Wen and Xiao Ling and Yongqiang Yang and Michael R. Lyu},
  journal= {arXiv preprint arXiv:2108.12179},
  year   = {2021}
}

备注

Accepted by 2021 36th IEEE/ACM International Conference on Automated Software Engineering (ASE'21)