利用自动编码器在高性能计算系统中进行异常检测
机器学习
2020-07-30 v1 人工智能
摘要
由于系统规模庞大且组件数量众多,超级计算机中的异常检测是一个极为困难的问题。当前自动化异常检测的最先进水平采用机器学习方法或统计回归模型以有监督方式进行,即检测工具被训练以区分一组固定的行为类别(健康与不健康状态)。我们提出了一种基于机器学习(深度)学习技术、即一种称为自动编码器的神经网络的高性能计算系统异常检测新方法。其核心思想是训练一组自动编码器学习超级计算机节点的正常(健康)行为,并在训练后使用它们来识别异常条件。这与以往基于学习异常条件的方法不同,后者数据集小得多(因为起初就很难识别它们)。我们在一个配备细粒度、可扩展监控基础设施的真实超级计算机上测试了我们的方法,该基础设施可提供大量数据以表征系统行为。结果极为鼓舞人心:在训练阶段学习正常系统行为后,我们的方法能够以非常好的准确率(介于 88% 与 96% 之间)检测此前从未见过的异常。
引用
@article{arxiv.1811.05269,
title = {Anomaly Detection using Autoencoders in High Performance Computing Systems},
author = {Andrea Borghesi and Andrea Bartolini and Michele Lombardi and Michela Milano and Luca Benini},
journal= {arXiv preprint arXiv:1811.05269},
year = {2020}
}
备注
9 pages, 3 figures