基于深度学习的非稳定日志数据故障识别
软件工程
2022-04-07 v1 机器学习
摘要
云平台的可靠性具有重要意义,因为社会日益依赖运行在云上的复杂软件系统。为提升可靠性,云提供商正在自动化各类运维任务,其中故障识别常被考虑。自动化的前提是具备可观测性工具,而系统日志是常用手段。本文关注基于日志的故障识别。该问题具有挑战性,原因在于日志数据的不稳定性以及代码中显式日志记录故障覆盖的不完备性。为应对这两大挑战,我们提出一种称为 CLog 的故障识别方法。其核心思想基于我们的观察:将日志数据表示为子过程序列而非日志事件序列,可降低不稳定日志数据的影响。CLog 引入一种新颖的子过程提取方法,利用上下文感知神经网络和聚类方法提取有意义的子过程。对日志事件上下文的直接建模可识别因上下文突变导致的故障,从而应对日志记录故障覆盖不足的挑战。实验结果表明,学习到的子过程表示降低了输入的不稳定性,使 CLog 在故障识别子问题上优于基线——1)故障检测 F1 分数提升 9–24%,2)故障类型识别宏平均 F1 分数提升 7%。进一步分析表明,输入事件序列的不稳定性与检测性能之间存在与模型无关的负相关性。
引用
@article{arxiv.2204.02636,
title = {Failure Identification from Unstable Log Data using Deep Learning},
author = {Jasmin Bogatinovski and Sasho Nedelkoski and Li Wu and Jorge Cardoso and Odej Kao},
journal= {arXiv preprint arXiv:2204.02636},
year = {2022}
}
备注
This paper is accepted for publication at IEEE CCGrid 2022. For fairest citation, please use the original proceedings credentials