DeepTriage:云服务的故障自动转派辅助系统
分布式、并行与集群计算
2020-12-08 v1 人工智能
计算与语言
机器学习
摘要
随着云服务不断发展并产生高额收益,这些服务的停机成本正变得极其昂贵。为减少损失与服务停机,一个关键的首要步骤是及时执行故障分诊,即将服务故障指派给正确的负责团队的过程。错误的指派会带来额外的故障重路由,并使缓解时间增加 10 倍。然而,大型云服务中的自动化故障分诊面临诸多挑战:(1)来自大量团队的极度不均衡故障分布,(2)输入数据格式或数据源的多样性,(3)满足生产级需求的可扩展性,以及(4)赢得工程师对机器学习推荐的信任。为应对这些挑战,我们引入 DeepTriage,一种智能故障转派服务,它结合多种机器学习技术——梯度提升分类器、聚类方法和深度神经网络——以集成方式推荐负责分诊故障的团队。Microsoft Azure 上真实故障的实验结果显示,我们的服务达到 82.9% 的 F1 分数。对于高影响故障,DeepTriage 的 F1 分数在 76.3% 至 91.3% 之间。我们应用最佳实践和 SOTA 框架将 DeepTriage 扩展至处理所有云服务的故障路由。DeepTriage 自 2017 年 10 月起部署于 Azure,每日被数千个团队使用。
引用
@article{arxiv.2012.03665,
title = {DeepTriage: Automated Transfer Assistance for Incidents in Cloud Services},
author = {Phuong Pham and Vivek Jain and Lukas Dauterman and Justin Ormont and Navendu Jain},
journal= {arXiv preprint arXiv:2012.03665},
year = {2020}
}