评估用于网络入侵检测的表格表示学习
机器学习
2026-05-05 v1 密码学与安全
摘要
经典的网络入侵检测系统 (NIDS) 通常依赖于手动特征工程从网络流量数据中提取有意义的模式。然而,这一方法需要领域专业知识,且与现代机器学习和神经网络广泛采用的原则相矛盾:即模型本身应从数据中直接学习有意义的表示。我们研究了表格表示学习技术是否能够通过自动学习稳健的特征表示来提高入侵检测性能。本文对最新表征学习方法在基准 NetFlow 数据集上的系统性评估,对比了传统自编码器和端到端 transformer 基线。我们使用监督分类器和无监督异常检测器评估所学表示,并对每种组合进行全面的超参数探索。我们的结果揭示了强烈的数据集-模型依赖性,没有单一方法在所有情景下均一致优越。对于监督分类,TabICL 在 CIDDS 上实现最佳性能,而自编码器紧随其后,同时在所有数据集上的平均排名与端到端 transformer 模型持平。监督方法在无监督异常检测方法中显著优于后者,后者没有单一组合在所有数据集上一致占优,最佳选择取决于数据集。跨数据集迁移实验表明,所学表示可以在合适的方法和分类器选择下跨网络环境实现泛化。然而,迁移性能在不同来源-目标数据集组合之间存在显著差异,表明其对网络环境之间的分布差异较为敏感。
引用
@article{arxiv.2605.02519,
title = {Evaluating Tabular Representation Learning for Network Intrusion Detection},
author = {Muhammad Usman Butt and Andreas Hotho and Daniel Schlör},
journal= {arXiv preprint arXiv:2605.02519},
year = {2026}
}
备注
IEEE International Conference on Cyber Security and Resilience (2026)