中文

关于机器学习在网络入侵检测中的跨数据集泛化

密码学与安全 2025-09-18 v1 机器学习 网络与互联网体系结构

摘要

网络入侵检测系统 (NIDS) 是网络安全的基本工具。其在不同网络间的泛化能力是其有效性的关键因素,也是实际应用的前提条件。在本研究中,我们通过跨数据集框架下的广泛实验,对基于机器学习的 NIDS 的泛化能力进行了全面分析。我们采用了四种机器学习分类器,并利用了从不同网络获取的四个数据集:CIC-IDS-2017、CSE-CIC-IDS2018、LycoS-IDS2017 和 LycoS-Unicas-IDS2018。值得注意的是,最后一个数据集是一项新贡献,其中我们基于 LycoS-IDS2017 对知名的 CSE-CIC-IDS2018 数据集应用了修正。结果显示,当模型在同一数据集上进行训练和测试时,分类性能近乎完美。然而,当以跨数据集方式训练和测试模型时,除了少数攻击和数据集组合外,分类准确率大致相当于随机猜测。我们采用数据可视化技术以提供关于数据模式的宝贵见解。我们的分析揭示了数据中存在的异常,这些异常直接阻碍了分类器将所学知识泛化到新场景的能力。本研究增强了我们对基于机器学习的 NIDS 泛化能力的理解,强调了承认数据异质性的重要性。

关键词

引用

@article{arxiv.2402.10974,
  title  = {On the Cross-Dataset Generalization of Machine Learning for Network Intrusion Detection},
  author = {Marco Cantone and Claudio Marrocco and Alessandro Bria},
  journal= {arXiv preprint arXiv:2402.10974},
  year   = {2025}
}