基于大语言模型的更强、更廉价且无需示例的日志解析
软件工程
2024-06-13 v2
摘要
日志解析,即将原始日志消息转换为结构化格式的过程,是自动化分析大规模软件系统日志的重要初始步骤。传统的日志解析器通常依赖于启发式方法或手工设计的特征,这些方法可能无法很好地泛化到不同的日志源,或者需要大量的模型调优。最近,一些日志解析器利用了大型语言模型(LLM)强大的生成能力。然而,它们严重依赖演示示例,导致LLM调用产生大量开销。为了解决这些问题,我们提出了LogBatcher,一种经济高效的基于LLM的日志解析器,无需训练过程或标注数据。为了利用日志数据的潜在特征并减少开销,我们通过聚类将日志划分为多个分区。然后,我们执行缓存匹配过程,将日志与先前解析的日志模板进行匹配。最后,我们通过将每个分区中的一组日志进行批处理,为LLM提供专门针对日志解析的更好的提示上下文。我们在16个公开日志数据集上进行了实验,结果表明LogBatcher对于日志解析是有效且高效的。
引用
@article{arxiv.2406.06156,
title = {Stronger, Cheaper and Demonstration-Free Log Parsing with LLMs},
author = {Yi Xiao and Van-Hoang Le and Hongyu Zhang},
journal= {arXiv preprint arXiv:2406.06156},
year = {2024}
}