中文

ContraLog:基于对比学习和掩码语言模型的日志文件异常检测

机器学习 2026-02-04 v1 人工智能

摘要

日志文件记录了反映系统状态和行为的计算事件,因而是现代计算机系统中获取运营洞察的主要数据源。自动化的日志异常检测因此至关重要,但大多数已建立的方法依赖日志解析器,将消息压缩为离散模板,导致变量值和语义内容被丢弃。我们提出 ContraLog,这是一种无需解析器且基于自监督的方法,将日志异常检测重新框定为预测连续消息嵌入,而非离散模板 ID。ContraLog 将产生单个日志消息丰富嵌入的消息编码器与用于建模序列内部时间依赖性的序列编码器相结合。该模型结合掩码语言模型和对比学习进行训练,以基于周围上下文预测被掩码的消息嵌入。在 HDFS、BGL 和 Thunderbird 基准数据集上的实验经验证明,该方法在具有多样化日志消息的复杂数据集上效果显著。此外,我们发现 ContraLog 生成的消息嵌入携带有意义的信息,即使没有序列上下文,也能预测异常。这些结果突显了基于嵌入级别的预测方法对于日志异常检测的潜力,并可能适用于其他事件序列。

关键词

引用

@article{arxiv.2602.03678,
  title  = {ContraLog: Log File Anomaly Detection with Contrastive Learning and Masked Language Modeling},
  author = {Simon Dietz and Kai Klede and An Nguyen and Bjoern M Eskofier},
  journal= {arXiv preprint arXiv:2602.03678},
  year   = {2026}
}

备注

26 pages with 16 figures