中文

对用于评估基于序列异常检测技术的常用日志数据集的批判性综述

机器学习 2024-09-06 v1

摘要

日志数据存储与系统或应用底层工作流相对应的事件执行模式。尽管多数日志具有信息性,日志数据也包含指示故障或事件的产物。因此,日志数据常被用于评估旨在自动揭示意外或其他相关系统行为模式的异常检测技术。近来,利用深度学习的检测方法日益关注在正常事件轨迹中表现为序列模式变化的异常。若干公开可用数据集,如 HDFS、BGL、Thunderbird、OpenStack 与 Hadoop,已成为评估这些异常检测技术的标准,然而这些数据集的适用性过去未被深入考察。本文因而分析六个公开日志数据集,重点关注异常的呈现形式及其检测的简易技术。我们的发现表明,多数异常并非直接与序列呈现相关,且在这些数据集上达到高检测率并不需要先进的检测技术。

关键词

引用

@article{arxiv.2309.02854,
  title  = {A Critical Review of Common Log Data Sets Used for Evaluation of Sequence-based Anomaly Detection Techniques},
  author = {Max Landauer and Florian Skopik and Markus Wurzenberger},
  journal= {arXiv preprint arXiv:2309.02854},
  year   = {2024}
}