DeepParse:利用LLM合成正则表达式掩码的混合日志解析方法
软件工程
2026-04-23 v1
摘要
现代分布式系统产生海量、异构的日志,这些日志对于可靠性、安全性和异常检测至关重要。将这些自由格式的消息转换为结构化模板(日志解析)具有挑战性,因为格式不断演变且标注数据有限。基于机器学习的解析器(如Drain)速度快,但在处理复杂变量时准确率往往下降,而大语言模型(LLM)虽然泛化能力更强,但推理成本过高。本文提出了DeepParse,这是一个混合框架,它利用LLM从小规模日志样本中自动挖掘可复用的变量模式,然后通过Drain算法确定性地应用这些模式。通过将推理阶段与执行阶段分离,DeepParse实现了准确、可扩展且成本高效的日志结构化,无需依赖脆弱的、手工制定的规则或逐行神经推理。在16个基准数据集上,DeepParse在变量提取方面实现了更高的准确率(平均解析准确率为97.6%),并且比启发式方法和纯LLM基线具有更好的一致性。将DeepParse集成到异常检测流程中,与启发式基线相比,误报率降低了30%以上,推理延迟降低了36%。
引用
@article{arxiv.2604.20553,
title = {DeepParse: Hybrid Log Parsing with LLM-Synthesized Regex Masks},
author = {Amir Shetaia and Sean Kauffman},
journal= {arXiv preprint arXiv:2604.20553},
year = {2026}
}