中文

SchemaCoder:基于残差 Q 树提升的自动日志模式提取编码器

人工智能 2025-08-27 v1

摘要

日志模式提取从大规模日志数据中派生人类可读模板,是实现自动化 schema 提取的关键任务,却一直备受挑战。近期研究尝试利用大型语言模型(LLM)实现自动化 schema 提取,但现有方法不可避免地依赖预定义正则表达式,需依赖人类领域知识,严重限制了生产力提升。为根本解决这一局限,我们引入 SchemaCoder——首个无需在流程中需人类定制即可适用于广泛日志文件格式的全自动 schema 提取框架。其核心是 novel Residual Question-Tree(Q-Tree)提升机制,通过由 LLM 驱动的有针对性、自适应查询迭代细化 schema 提取。具体而言,该方法通过受限分段将日志划分为语义块,通过基于嵌入的抽样挑选代表性模式,通过层次 Q-Tree 驱动的 LLM 查询生成 schema 代码,并通过文本-残差进化优化器和残差提升进行迭代细化。实验验证表明,SchemaCoder 在广泛使用的 LogHub-2.0 数据集上优于现有方法,平均提升 21.3%。

关键词

引用

@article{arxiv.2508.18554,
  title  = {SchemaCoder: Automatic Log Schema Extraction Coder with Residual Q-Tree Boosting},
  author = {Lily Jiaxin Wan and Chia-Tung Ho and Rongjian Liang and Cunxi Yu and Deming Chen and Haoxing Ren},
  journal= {arXiv preprint arXiv:2508.18554},
  year   = {2025}
}

备注

18 pages, 16 figures, under review for AAAI2026