面向 AIOps 的日志表示学习
计算与语言
2023-08-23 v1 人工智能
软件工程
摘要
IT 运维人工智能(AIOps)是一个强大的平台,站点可靠性工程师(SRE)借此以最少的人为干预实现运维工作流的自动化与精简。自动化日志分析是 AIOps 中的一项关键任务,因为它为 SRE 识别和解决正在发生的故障提供了关键洞察。日志格式检测、日志分类和日志解析等任务是自动化日志分析的核心组成部分。这些任务大多需要监督学习;然而,由于标注日志数据有限以及日志数据性质多样,存在多重挑战。诸如 BERT 和 GPT3 等大型语言模型(LLM)利用海量无标注数据通过自监督进行训练。这些模型提供的通用表示可有效用于标注数据有限的各类下游任务。受 LLM 在科学与生物等特定领域成功的启发,本文提出一个在公开与专有日志数据上训练的日志数据 LLM。实验结果表明,所提出的 LLM 在多个下游任务上优于现有模型。总之,由 LLM 驱动的 AIOps 为自动化日志分析任务提供了高效且有效的解决方案,并使 SRE 能够专注于更高层次的任务。我们提出的在公开与专有日志数据上训练的 LLM,在多个下游任务上表现出更优性能,使其成为 AIOps 平台的有价值补充。
引用
@article{arxiv.2308.11526,
title = {Learning Representations on Logs for AIOps},
author = {Pranjal Gupta and Harshit Kumar and Debanjana Kar and Karan Bhukar and Pooja Aggarwal and Prateeti Mohapatra},
journal= {arXiv preprint arXiv:2308.11526},
year = {2023}
}
备注
11 pages, 2023 IEEE 16th International Conference on Cloud Computing (CLOUD)