VarParser:释放变量的被忽视力量用于 LLM 日志解析
软件工程
2026-03-13 v2
摘要
日志是工程师诊断大规模在线服务系统故障的主要信息来源。日志解析从海量非结构化日志数据中提取结构化事件,是下游任务(如异常检测和故障诊断)的关键第一步。随着大型语言模型(LLM)的发展,利用其强大的文本理解能力在日志解析中取得了良好效果。然而,现有基于 LLM 的日志解析器均关注日志中常数部分,忽视了变量部分对解析的潜在贡献。这种以常数为中心的策略带来四个关键问题:其一,仅凭常数信息导致日志分组和抽样效率低下;其二,常数驱动的缓存机制导致 LLM 调用次数较多,造成解析准确率和效率低下;其三,提示词中消耗大量常数 token,导致 LLM 调用成本高昂;其四,仅保留占位符,丢失了变量信息带来的系统可见性。面对这些问题,本文提出一种以变量为中心的日志解析策略,命名为 VarParser。通过变量贡献抽样、变量中心化缓存和自适应变量感知的 in-context 学习,VarParser 可高效捕获日志的变量部分并利用其对解析的贡献。通过引入变量单元,保留丰富的变量信息,增强日志解析结果的完整性。大规模数据集上的广泛评估表明,VarParser 在准确率上优于现有方法,显著提升解析效率,同时降低 LLM 调用成本。
引用
@article{arxiv.2601.22676,
title = {VarParser: Unleashing the Neglected Power of Variables for LLM-based Log Parsing},
author = {Jinrui Sun and Tong Jia and Minghua He and Ying Li},
journal= {arXiv preprint arXiv:2601.22676},
year = {2026}
}
备注
Published as a conference paper in WWW 2026