中文

基准的基准——合成网络入侵检测数据集分析

网络与互联网体系结构 2024-01-09 v1 密码学与安全 机器学习

摘要

网络入侵检测系统(NIDS)是预防与缓解网络攻击的日益重要的工具。研究人员已生成若干带标签的合成数据集并公开,它们已成为评估新基于机器学习的 NIDS 分类器的基准。近期发表的结果显示,使用这些数据集的分类性能优异,在准确率、F1 分数等关键评估指标上日益接近 100%。遗憾的是,我们尚未看到这些优异的学术研究结果表明在实际 NIDS 系统中达到如此近乎完美的性能。这促使了本文所呈现的研究,我们分析三个较新且相关的 NIDS 数据集(CIC、UNSW 等)中良性流量的统计特性。作为对比,我们考虑从真实生产网络获得的两个数据集,一个来自某大学网络,一个来自中型互联网服务提供商(ISP)。我们的结果显示,两个真实数据集就大多数所考虑的统计特征而言彼此十分相似。同样,三个合成数据集在其组内也相对相似。然而且最重要的是,我们的结果显示三个合成数据集与两个真实数据集之间大多数所考虑的统计特征存在明显差异。由于机器学习依赖训练与测试数据集来自同一分布的基本假设,这引发了在考虑的合成数据集上训练的机器学习分类器的性能结果能在多大程度上转化并泛化到真实网络的问题。我们认为这是一个有趣且相关的问题,为进一步研究提供了动机。

关键词

引用

@article{arxiv.2104.09029,
  title  = {Benchmarking the Benchmark -- Analysis of Synthetic NIDS Datasets},
  author = {Siamak Layeghy and Marcus Gallagher and Marius Portmann},
  journal= {arXiv preprint arXiv:2104.09029},
  year   = {2024}
}

备注

25 pages, 13 figures