如何配置软件日志上的掩码事件异常检测?
软件工程
2022-08-04 v1
摘要
基于掩码事件预测的软件日志异常事件检测拥有多种技术途径及无数配置与参数。我们的目标是为未来类似研究提供一套基线设置。使用的模型为 N-Gram 模型(自然语言处理(NLP)领域的经典方法)以及两个深度学习(DL)模型长短期记忆(LSTM)和卷积神经网络(CNN)。数据集采用 Profilence、BlueGene/L (BGL)、Hadoop Distributed File System (HDFS) 和 Hadoop 四个数据集。其他设置包括滑动窗口大小(决定用于预测给定事件的周围事件数量)、掩码位置(窗口内待预测的位置)、仅使用唯一序列,以及用于训练的数据比例。结果清晰指示了可跨数据集泛化的设置。随着窗口增大,DL 模型性能未退化,而 N-Gram 模型在 BGL 与 Profilence 数据集上大窗口时表现更差。尽管 Next Event Prediction 广受欢迎,结果表明在此情形下最好不要预测子序列边缘(即首或末)事件,窗口大小为 5 时预测第 4 个事件效果最佳。关于训练数据量,各数据集与模型间存在差异。例如,N-Gram 模型比 DL 模型对数据缺乏更敏感。总体而言,针对类似实验设置我们建议如下通用基线:窗口大小 10、掩码位置倒数第二、不过滤非唯一序列、使用总量一半的数据训练。
引用
@article{arxiv.2208.01991,
title = {How to Configure Masked Event Anomaly Detection on Software Logs?},
author = {Jesse Nyyssölä and Mika Mäntylä and Martín Varela},
journal= {arXiv preprint arXiv:2208.01991},
year = {2022}
}
备注
Accepted to the New Ideas and Emerging Results (NIER) track of the 38th IEEE International Conference on Software Maintenance and Evolution (ICSME)