中文

面向网络安全应用的异常检测机器学习分类器性能评估

机器学习 2025-04-29 v1 密码学与安全

摘要

本工作对两种不平衡公开数据集(KDDCUP99 和 Credit Card Fraud 2013)上的机器学习模型进行经验性评估。方法包括数据准备、模型训练和评估,使用 80/20(训练/测试)划分。测试的模型包括 eXtreme Gradient Boosting(XGB)、多层感知器(MLP)、生成对抗网络(GAN)、变分自编码器(VAE)以及多目标生成对抗主动学习(MO-GAAL),其中 XGB 和 MLP 进一步与随机过采样(ROS)和自paced-Ensemble(SPE)组合。评估包括 5 折交叉验证和 impute 技术(均值、中位数和 IterativeImputer),以及 10%、20%、30% 和 50% 缺失数据。结果表明 XGB 和 MLP 在生成模型中表现更佳。IterativeImputer 的结果相当于均值和中位数,但由于复杂度和执行时间的增加,不推荐用于大型数据集。所用代码已公开于 GitHub(github.com/markushaug/acr-25)。

关键词

引用

@article{arxiv.2504.18771,
  title  = {Performance of Machine Learning Classifiers for Anomaly Detection in Cyber Security Applications},
  author = {Markus Haug and Gissel Velarde},
  journal= {arXiv preprint arXiv:2504.18771},
  year   = {2025}
}