高性能计算机中的异常检测:一种邻近视角
分布式、并行与集群计算
2019-10-21 v1 计算机视觉与模式识别
系统与控制
系统与控制
摘要
为满足对更高计算能力的需求,高性能计算机(HPC)中的计算节点数量迅速增加。预计到2020年将出现百亿亿次HPC系统。随着HPC系统组件数量的急剧增加,预计将观察到故障数量的突然上升,从而对HPC系统的持续运行构成威胁。尽早检测故障,并理想地预测故障,是避免HPC系统运行中断的必要步骤。异常检测是计算系统中一种众所周知的通用故障检测方法。现有的大多数方法针对特定架构设计,需要对计算系统的硬件和软件进行调整,需要过多的信息,或对用户和系统的隐私构成威胁。本工作提出了一种基于邻近统计异常检测方法的节点故障检测机制,使用被动收集且匿名化的系统日志条目。将所提出的方法应用于超过8个月收集的系统日志,结果表明异常检测精确率在62%至81%之间。
引用
@article{arxiv.1906.04550,
title = {Anomaly Detection in High Performance Computers: A Vicinity Perspective},
author = {Siavash Ghiasvand and Florina M. Ciorba},
journal= {arXiv preprint arXiv:1906.04550},
year = {2019}
}
备注
9 pages, Submitted to the 18th IEEE International Symposium on Parallel and Distributed Computing