中文

用于基于机器学习的网络入侵检测系统的NetFlow数据集

网络与互联网体系结构 2021-05-18 v1

摘要

基于机器学习 (ML) 的网络入侵检测系统 (NIDSs) 已被证明是保护网络免受网络攻击的可靠智能工具。网络数据特征对基于ML的NIDSs的性能有很大影响。然而,评估ML模型通常并不可靠,因为每个启用ML的NIDS都是使用可能不包含安全事件的不同数据特征来训练和验证的。因此,需要一个来自多个数据集的通用基础特征集来评估ML模型的检测精度及其跨数据集的泛化能力。本文利用公开可用的数据包捕获文件,从四个基准NIDS数据集(即 UNSW-NB15、BoT-IoT、ToN-IoT 和 CSE-CIC-IDS2018)中提取了 NetFlow 特征。在真实场景中,与原始数据集中使用的复杂特征相比,NetFlow特征相对更容易从网络流量中提取,因为它们通常从数据包头中提取。生成的NetFlow数据集已标记用于解决二元和多类学习挑战。初步结果表明,与各自原始特征数据集相比,NetFlow特征在这四个数据集中产生了相似的二元分类结果和较低的多类分类结果。这些NetFlow数据集被命名为 NF-UNSW-NB15、NF-BoT-IoT、NF-ToN-IoT、NF-CSE-CIC-IDS2018 和 NF-UQ-NIDS,已发布在 http://staff.itee.uq.edu.au/marius/NIDS_datasets/ 供研究使用。

关键词

引用

@article{arxiv.2011.09144,
  title  = {NetFlow Datasets for Machine Learning-based Network Intrusion Detection Systems},
  author = {Mohanad Sarhan and Siamak Layeghy and Nour Moustafa and Marius Portmann},
  journal= {arXiv preprint arXiv:2011.09144},
  year   = {2021}
}