大语言模型遇上机器学习:面向不稳定日志的数据高效异常检测
软件工程
2025-10-10 v4
摘要
大多数基于日志的异常检测器假设日志是稳定的,但由于软件或环境变化,日志往往是不稳定的。因此,针对不稳定日志的异常检测(ULAD)是更真实且尚未充分研究的挑战。当前方法主要依赖机器学习(ML)模型,这些模型通常需要大量标记数据进行训练。为缓解数据不足的问题,我们提出了一种 novel 的混合方法 FlexLog,用于 ULAD,将决策树、k 近邻和馈送神经网络等 ML 模型与大语言模型(Mistral)通过集成学习相结合。FlexLog 还 incorporates 缓存和检索增强生成(RAG)以进一步提升效率和效果。为评估 FlexLog,我们配置了四个数据集用于 \task,包括 ADFA-U、LOGEVOL-U、SynHDFS-U 和 SYNEVOL-U。FlexLog 在 F1 分数上至少提高了 1.2 个百分点,同时使用 much less 标记数据(减少 62.87 pp)。当在与基线方法相同的数据量下训练时,FlexLog 在 ADFA-U 上可实现最高提升 13 pp 的 F1 分数。此外,FlexLog 在推理时间上维持在每个日志序列以下一秒,适用于大多数应用,仅限于延迟敏感系统。进一步分析揭示了 FlexLog 各关键组件(缓存、RAG 和集成学习)的积极影响。
引用
@article{arxiv.2406.07467,
title = {LLM meets ML: Data-efficient Anomaly Detection on Unstable Logs},
author = {Fatemeh Hadadi and Qinghua Xu and Domenico Bianculli and Lionel Briand},
journal= {arXiv preprint arXiv:2406.07467},
year = {2025}
}
备注
Accepted by ACM Transactions on Software Engineering and Methodology (TOSEM) 2025