SoK:无标注数据在网威胁检测中的影响
密码学与安全
2022-06-28 v1 机器学习
摘要
近年来,机器学习(ML)已成为网威胁检测(CTD)的重要范式。大量研究工作投入于开发面向 CTD 任务的专用算法。然而从运维角度看,基于 ML 的 CTD 进展受限于难以获取用于训练 ML 检测器的大规模标注数据。该问题的潜在解决方案是半监督学习(SsL)方法,其将小型标注数据集与大量无标注数据结合。本文旨在对现有 SsL 用于 CTD 的工作进行系统化梳理,尤其着眼于理解无标注数据在此类系统中的效用。为此,我们分析各类 CTD 任务中的标注代价,并据此构建形式化代价模型。在此基础上,我们形式化了一套用于评估 SsL 方法的需求,以阐明无标注数据的贡献。我们回顾了现有前沿工作,发现此前无一满足此类需求。为应对该问题,我们提出一个用于评估 SsL 中无标注数据收益的框架。我们通过执行首个基准评估来展示该框架的应用,其突显了 9 种现有 SsL 方法在 9 个公开数据集上的权衡。我们的发现证实,在某些情况下,无标注数据带来了微小但统计显著的性能提升。本文强调 CTD 中的 SsL 仍有很大改进空间,应能促进该领域的未来研究。
引用
@article{arxiv.2205.08944,
title = {SoK: The Impact of Unlabelled Data in Cyberthreat Detection},
author = {Giovanni Apruzzese and Pavel Laskov and Aliya Tastemirova},
journal= {arXiv preprint arXiv:2205.08944},
year = {2022}
}