Lemur:基于熵采样与思维链合并的日志解析
软件工程
2025-03-27 v5 人工智能
摘要
大型软件系统产生的日志对于监控系统行为至关重要。先进的日志分析有助于系统故障的检测、警报和诊断。日志解析是将原始日志消息转换为结构化模板的过程,构成了日志分析自动化的关键阶段。现有的日志解析器由于依赖人工规则而无法识别正确的模板。此外,这些方法关注统计特征而忽略了日志消息中的语义信息。为应对这些挑战,我们引入了一种具有熵采样和思维链合并功能的最先进日志解析框架 Lemur。具体而言,为了摒弃繁琐的人工规则,我们提出了一种受信息熵启发的新型采样方法,该方法能高效聚类典型日志。此外,为了增强日志模板的合并,我们为大型语言模型(LLMs)设计了一种思维链方法。LLMs 表现出卓越的语义理解能力,并能巧妙地区分参数和不变令牌。我们在大规模公共数据集上进行了实验。广泛的评估表明,Lemur 实现了最先进的性能和令人印象深刻的效率。代码可在 https://github.com/zwpride/lemur 获取。
引用
@article{arxiv.2402.18205,
title = {Lemur: Log Parsing with Entropy Sampling and Chain-of-Thought Merging},
author = {Wei Zhang and Xiangyuan Guan and Lu Yunhong and Jie Zhang and Shuangyong Song and Xianfu Cheng and Zhenhe Wu and Zhoujun Li},
journal= {arXiv preprint arXiv:2402.18205},
year = {2025}
}