基于日志的深度学习异常检测:我们进展几何?
软件工程
2022-02-16 v2 机器学习
摘要
软件密集型系统产生日志以用于故障排查。近来,许多深度学习模型被提出以基于日志数据自动检测系统异常。这些模型通常宣称具有极高的检测准确率。例如,多数模型在常用的 HDFS 数据集上报告的 F-measure 大于 0.9。为深入理解我们在解决基于日志的异常检测问题上进展几何,本文对五个最先进的基于深度学习的模型在四个公共日志数据集上检测系统异常进行了深入分析。我们的实验聚焦于模型评估的若干方面,包括训练数据选择、数据分组、类别分布、数据噪声与早期检测能力。我们的结果表明,所有这些方面都对评估有显著影响,且所有被研究模型并非总是表现良好。基于日志的异常检测问题尚未解决。基于我们的发现,我们也给出了可能的未来工作建议。
引用
@article{arxiv.2202.04301,
title = {Log-based Anomaly Detection with Deep Learning: How Far Are We?},
author = {Van-Hoang Le and Hongyu Zhang},
journal= {arXiv preprint arXiv:2202.04301},
year = {2022}
}
备注
Accepted by The 44th International Conference on Software Engineering (ICSE 2022)