RUAD:面向 HPC 系统的无监督异常检测
机器学习
2022-08-30 v1 人工智能
摘要
现代高性能计算(HPC)系统日益复杂,亟需引入自动化与数据驱动的方法,以协助系统管理员提升系统可用性。异常检测是提高可用性的关键环节,它减轻了系统管理员的负担,并缩短了异常与其解决之间的时间。然而,当前最先进的(SoA)异常检测方法为有监督与半监督方法,因此需要带异常的人工标注数据集——这在生产型 HPC 系统中往往难以收集。旨在缓解对准确异常数据需求的基于聚类的无监督异常检测方法,迄今表现不佳。本工作中,我们提出一种新颖的循环无监督异常检测模型 RUAD,克服了上述局限。RUAD 取得了优于当前半监督与无监督 SoA 方法的结果。这是通过考虑数据中的时间依赖关系并在模型架构中引入长短期记忆单元实现的。所提方法在 Tier-0 系统(CINECA 的 Marconi100,含 980 个节点)完整的十个月历史数据上进行了评估。RUAD 在半监督训练下曲线下面积(AUC)达 0.763,在无监督训练下达 0.767,优于 SoA 方法在半监督训练下 AUC 0.747 与无监督训练下 0.734 的表现。其也大幅优于当前基于聚类的 SoA 无监督异常检测方法(AUC 仅为 0.548)。
引用
@article{arxiv.2208.13169,
title = {RUAD: unsupervised anomaly detection in HPC systems},
author = {Martin Molan and Andrea Borghesi and Daniele Cesarini and Luca Benini and Andrea Bartolini},
journal= {arXiv preprint arXiv:2208.13169},
year = {2022}
}