面向可操作告警识别的机器学习:一项全面综述
软件工程
2024-10-08 v2
摘要
可操作告警识别(Actionable Warning Identification, AWI)在提升静态代码分析器的可用性方面起着关键作用。随着机器学习(Machine Learning, ML)的近期进展,已有多种方法被提出将 ML 技术引入 AWI。这些基于 ML 的 AWI 方法得益于 ML 从历史数据中学习细微且先前未见模式的能力,已展现出优越性能。然而,目前缺少对这些方法的全面概览,这可能阻碍研究人员/从业者理解当前进展并发现基于 ML 的 AWI 领域的潜在改进空间。本文中,我们系统性地回顾了最先进的基于 ML 的 AWI 方法。首先,我们采用细致的综述方法,收集了从 2000/01/01 到 2023/09/01 的 51 篇原始研究。然后,我们勾勒了典型的基于 ML 的 AWI 工作流程,包括告警数据集准备、预处理、AWI 模型构建与评估阶段。在此工作流程中,我们依据告警输出格式对基于 ML 的 AWI 方法进行分类。此外,我们分析了各阶段所使用的技术及其优势、劣势与分布。最后,我们针对未来基于 ML 的 AWI 方法给出了实用的研究方向,聚焦于数据改进(如增强告警标注策略)与模型探索(如探索用于 AWI 的大语言模型)等方面。
引用
@article{arxiv.2312.00324,
title = {Machine Learning for Actionable Warning Identification: A Comprehensive Survey},
author = {Xiuting Ge and Chunrong Fang and Xuanye Li and Weisong Sun and Daoyuan Wu and Juan Zhai and Shangwei Lin and Zhihong Zhao and Yang Liu and Zhenyu Chen},
journal= {arXiv preprint arXiv:2312.00324},
year = {2024}
}
备注
Accepted by CSUR