中文

在稳定性测试日志中精确定位异常事件:N-Gram 与深度学习的对比

软件工程 2022-02-24 v2

摘要

由于稳定性测试执行日志可能非常长,软件工程师需要帮助来定位异常事件。我们开发并评估了两个用于对单个日志事件的异常程度进行评分的模型,即一个 N-Gram 模型和一个带有 LSTM(长短期记忆)的深度学习模型。两者均仅在正常日志序列上训练。我们使用我们公司案例中的 Android 稳定性测试长日志序列和来自 HDFS(Hadoop 分布式文件系统)公开数据集的短日志序列评估了这些模型。我们评估了下一事件预测准确率和计算效率。LSTM 模型在稳定性测试日志中更准确(0.848 对 0.865),而在 HDFS 日志中 N-Gram 略微更准确(0.904 对 0.900)。与深度模型相比,N-Gram 模型具有远优越的计算效率(4 到 13 秒 对 16 分钟到近 4 小时),使其成为我们案例公司的首选。对单个日志事件的异常程度进行评分似乎有助于对失败测试用例进行根因分析,我们的案例公司计划将其添加到其在线服务中。尽管最近在软件系统异常检测中使用深度学习的热潮激增,我们发现这样做的收益有限。然而,未来的工作应考虑我们的发现在不同的 LSTM 模型超参数、其他数据集以及那些有望比基于 LSTM 的模型提供更好准确率和计算效率的其他深度学习方法下是否仍然成立。

关键词

引用

@article{arxiv.2202.09214,
  title  = {Pinpointing Anomaly Events in Logs from Stability Testing -- N-Grams vs. Deep-Learning},
  author = {Mika Mäntylä and Martín Varela and Shayan Hashemi},
  journal= {arXiv preprint arXiv:2202.09214},
  year   = {2022}
}

备注

Accepted to 5th Workshop on NEXt level of Test Automation (NEXTA), ICST Workshops 2022