中文

基于异常的网络入侵检测基准数据集:KDD CUP 99 的替代方案

机器学习 2019-01-15 v1 人工智能 密码学与安全 机器学习

摘要

机器学习在基于异常的网络入侵检测系统(A-NIDS)中的应用正稳步获得关注。该领域研究常使用 KDD~CUP~99 数据集作为基准。若干研究因其响应分布偏斜、非平稳性以及未纳入现代攻击,质疑其在构建当代 NIDS 时的可用性。本文中,我们比较文献中常见分类模型训练下 KDD-99 替代方案的性能:神经网络、支持向量机、决策树、随机森林、朴素贝叶斯与 K-Means。应用 SMOTE 过采样技术与随机欠采样,我们创建了 NSL-KDD 的平衡版本,并证明 KDD-99 与 NSL-KDD 中偏斜的目标类别损害了分类器对少数类(U2R 与 R2L)的效力,导致潜在安全风险。我们探究了 UNSW-NB15,一种模式分布更均匀的 KDD-99 现代替代数据集。我们在 SMOTE 过采样前后对该数据集进行基准测试以观察对少数类性能的影响。我们的结果表明,在二分类情形下,训练于 UNSW-NB15 的分类器匹配或优于训练于 NSL-KDD 与 KDD-99 的分类器的加权 F1 分数,从而主张 UNSW-NB15 作为这些数据集的现代替代。

关键词

引用

@article{arxiv.1811.05372,
  title  = {Benchmarking datasets for Anomaly-based Network Intrusion Detection: KDD CUP 99 alternatives},
  author = {Abhishek Divekar and Meet Parekh and Vaibhav Savla and Rudra Mishra and Mahesh Shirole},
  journal= {arXiv preprint arXiv:1811.05372},
  year   = {2019}
}

备注

Paper accepted into Proceedings of IEEE International Conference on Computing, Communication and Security 2018 (ICCCS-2018) Statistics: 8 pages, 7 tables, 3 figures, 34 references