基于降维的自动化日志聚类改进问题识别
软件工程
2020-09-08 v1 信息检索
机器学习
摘要
目标:我们考虑将因相同潜在原因而失败的多次运行日志自动分组的问题,以便更有效地处理,并研究以下问题:(1)为识别系统日志中问题而开发的方法是否能推广到识别持续部署日志中的问题?(2)降维如何影响自动化日志聚类的质量?(3)聚类算法中用于合并簇的准则如何影响聚类质量?方法:我们复现并扩展了早前关于系统日志文件聚类的工作,以评估其向持续部署日志的推广性。我们考虑选择性地加入以下降维技术之一:主成分分析(PCA)、潜在语义索引(LSI)和非负矩阵分解(NMF)。此外,除早前工作所用的完全连接(Complete Linkage)准则外,我们考虑三种备选簇合并准则(单连接、平均连接和加权连接)。我们在工业合作方提供的持续部署日志上对所得到的 16 种配置进行了实证评估。结果:我们的研究表明(1)通过聚类识别持续部署日志中的问题可行,(2)加入 NMF 显著提升了整体准确率与鲁棒性,(3)完全连接在所有分析的合并准则中表现最佳。结论:我们得出结论,引入降维可改进基于自动化日志聚类的问题识别,因其降低了流水线对参数选择的敏感性,从而提升了对不同输入的鲁棒性。
引用
@article{arxiv.2009.03257,
title = {Improving Problem Identification via Automated Log Clustering using Dimensionality Reduction},
author = {Carl Martin Rosenberg and Leon Moonen},
journal= {arXiv preprint arXiv:2009.03257},
year = {2020}
}