AlertGuardian:面向大规模云系统的智能告警全生命周期管理
分布式、并行与集群计算
2026-01-22 v1 软件工程
摘要
告警对于检测大规模云系统中的异常、确保可靠性和用户体验至关重要。然而,当前系统会产生海量的告警,由于无效的告警全生命周期管理,导致运营效率下降。本文详细介绍了 X 公司优化告警全生命周期管理的工作,旨在解决云系统中的告警疲劳问题。我们提出了 AlertGuardian,这是一个结合大语言模型(LLMs)与轻量级图模型以通过三个阶段优化告警全生命周期的框架:告警去噪使用带有虚拟噪声的图学习模型来过滤噪声;告警摘要利用检索增强生成(RAG)与 LLMs 创建可操作的摘要;告警规则优化利用多智能体迭代反馈来提高告警规则质量。在 X 公司服务的四个真实世界数据集上进行评估,AlertGuardian 显著缓解了告警疲劳(告警减少率达 94.8%)并加速了故障诊断(诊断准确率为 90.5%)。此外,AlertGuardian 改进了 1,174 条告警规则,其中 375 条被 SRE 采纳(采纳率为 32%)。最后,我们分享了在 X 公司部署 AlertGuardian 后关于告警全生命周期管理的成功案例与经验教训。
引用
@article{arxiv.2601.14912,
title = {AlertGuardian: Intelligent Alert Life-Cycle Management for Large-scale Cloud Systems},
author = {Guangba Yu and Genting Mai and Rui Wang and Ruipeng Li and Pengfei Chen and Long Pan and Ruijie Xu},
journal= {arXiv preprint arXiv:2601.14912},
year = {2026}
}
备注
Accepted by ASE 2025