重审网络流量分析:面向ML模型的兼容网络流
密码学与安全
2025-11-12 v1 机器学习
网络与互联网体系结构
摘要
为确保机器学习(ML)模型能够进行稳健的网络攻击检测和分类,必须使用高质量的数据集进行训练,数据集具备相关特征。然而,尤其是在物联网(IoT)网络中,准确表示复杂攻击流量模式可能具有挑战性。本文研究了看似相似的特征由不同网络流量导出器创建时,对ML模型的泛化性和鲁棒性产生的影响。除了Bot-IoT、IoT-23和CICIoT23数据集的原始CSV文件外,我们还分析了它们的原始网络数据包,使用HERA工具生成新的标记化流并提取一致的特征,用于新的CSV版本。为了评估这些新流对入侵检测的有用性,我们将其与原始版本进行比较,并用于微调多个模型。总体而言,结果表明,直接分析和预处理PCAP文件,而仅使用常用的CSV文件,能够计算出更相关的特征来训练集成学习和梯度提升决策树模型。继续改进特征提取和特征选择过程以增加不同数据集的兼容性,对确保网络安全解决方案中所用ML模型进行可信的评估和比较至关重要。
引用
@article{arxiv.2511.08345,
title = {Revisiting Network Traffic Analysis: Compatible network flows for ML models},
author = {João Vitorino and Daniela Pinto and Eva Maia and Ivone Amorim and Isabel Praça},
journal= {arXiv preprint arXiv:2511.08345},
year = {2025}
}
备注
16 pages, 12 tables, 1 figure, FPS 2025 conference