中文

重审网络流量分析:面向ML模型的兼容网络流

密码学与安全 2025-11-12 v1 机器学习 网络与互联网体系结构

摘要

为确保机器学习(ML)模型能够进行稳健的网络攻击检测和分类,必须使用高质量的数据集进行训练,数据集具备相关特征。然而,尤其是在物联网(IoT)网络中,准确表示复杂攻击流量模式可能具有挑战性。本文研究了看似相似的特征由不同网络流量导出器创建时,对ML模型的泛化性和鲁棒性产生的影响。除了Bot-IoT、IoT-23和CICIoT23数据集的原始CSV文件外,我们还分析了它们的原始网络数据包,使用HERA工具生成新的标记化流并提取一致的特征,用于新的CSV版本。为了评估这些新流对入侵检测的有用性,我们将其与原始版本进行比较,并用于微调多个模型。总体而言,结果表明,直接分析和预处理PCAP文件,而仅使用常用的CSV文件,能够计算出更相关的特征来训练集成学习和梯度提升决策树模型。继续改进特征提取和特征选择过程以增加不同数据集的兼容性,对确保网络安全解决方案中所用ML模型进行可信的评估和比较至关重要。

关键词

引用

@article{arxiv.2511.08345,
  title  = {Revisiting Network Traffic Analysis: Compatible network flows for ML models},
  author = {João Vitorino and Daniela Pinto and Eva Maia and Ivone Amorim and Isabel Praça},
  journal= {arXiv preprint arXiv:2511.08345},
  year   = {2025}
}

备注

16 pages, 12 tables, 1 figure, FPS 2025 conference