中文

RAPID:基于检索且无需训练、结合词元级信息的预训练语言模型日志异常检测

机器学习 2023-11-10 v1 人工智能

摘要

随着 IT 产业发展,系统日志数据愈发关键。许多计算机系统因源代码访问受限而依赖日志文本进行管理。日志异常检测的需求日益增长,尤其在实际应用中,但在快速累积的日志中识别异常仍是一项挑战。传统的基于深度学习的异常检测模型需要特定于数据集的训练,带来相应延迟。值得注意的是,多数方法仅关注序列级日志信息,使细微异常的发现更困难,且常涉及难以实时应用的推理过程。我们提出 RAPID,一种利用日志数据固有特征实现无训练延迟异常检测、确保实时能力的模型。RAPID 将日志视为自然语言,使用预训练语言模型提取表示。鉴于日志可按系统上下文分类,我们采用基于检索的技术,将测试日志与最相似的正常日志进行对比。该策略不仅免除日志专用训练,还巧妙融入词元级信息,确保精细且鲁棒的检测,尤其针对未见过的日志。我们还提出核心集技术,可降低比较所需的计算成本。实验结果表明,即便未在日志数据上训练,RAPID 相较先前模型具竞争力,并在某些数据集上取得最佳性能。通过多项研究问题,我们验证了其实时无延迟检测的能力。

关键词

引用

@article{arxiv.2311.05160,
  title  = {RAPID: Training-free Retrieval-based Log Anomaly Detection with PLM considering Token-level information},
  author = {Gunho No and Yukyung Lee and Hyeongwon Kang and Pilsung Kang},
  journal= {arXiv preprint arXiv:2311.05160},
  year   = {2023}
}