中文

大型系统中可扩展的时序异常因果发现:基于二值异常标志数据实现计算高效性

机器学习 2025-12-24 v3 机器学习

摘要

一旦监控系统检测到系统故障,提取异常因果关系便有助于进行诊断。在大型系统中识别异常原因涉及考察跨多个子系统更广泛的监控变量集合。然而,学习图形因果模型(GCMs)伴随着显著的计算负担,这限制了大多数现有方法在实时和大规模部署中的适用性。此外,大型系统的现代监控应用通常生成大量二值报警标志,而二值异常数据的鲜明特征——状态转换的含义与数据稀疏性——对现有因果学习机制构成了挑战。本研究提出了一种异常因果发现方法(AnomalyCD),以解决从时序二值标志数据集中生成 GCMs 所面临的准确性与计算挑战。AnomalyCD 提出了若干策略,例如异常数据感知因果测试、稀疏数据与先验链接压缩,以及边剪枝调整方法。我们在两个数据集上验证了该方法的性能:来自 CERN 紧凑缪子螺线管实验读出盒系统的监控传感器数据,以及来自信息技术监控系统的公开数据集。在时序 GCMs 上的结果表明,在二值异常数据集上计算开销显著降低且准确率有适度提升。源代码:https://github.com/muleina/AnomalyCD 。

关键词

引用

@article{arxiv.2412.11800,
  title  = {Scalable Temporal Anomaly Causality Discovery in Large Systems: Achieving Computational Efficiency with Binary Anomaly Flag Data},
  author = {Mulugeta Weldezgina Asres and Christian Walter Omlin and The CMS-HCAL Collaboration},
  journal= {arXiv preprint arXiv:2412.11800},
  year   = {2025}
}

备注

34 pages, 17 figures, 8 tables