使用合成数据平衡数据对计算机网络入侵检测中机器学习分类器性能的影响
机器学习
2022-04-04 v1
摘要
近年来,对计算机网络的攻击显著增加,部分原因是存在用于发起此类攻击的复杂工具,以及支撑攻击的地下网络犯罪经济。过去几年中,学术界和工业界的研究人员使用机器学习(ML)技术来设计和实现计算机网络的入侵检测系统(IDSes)。其中许多研究人员使用各组织收集的数据集来训练用于预测入侵的ML模型。在这类系统使用的许多数据集中,数据是不平衡的(即并非所有类别都有相等数量的样本)。对于不平衡数据,使用ML算法开发的预测模型可能产生不令人满意的分类器,从而影响入侵预测的准确性。传统上,研究人员使用过采样和欠采样来平衡数据集中的数据以克服此问题。在这项工作中,除过采样外,我们还使用一种称为条件生成对抗网络(CTGAN)的合成数据生成方法来平衡数据,并研究它们对各种ML分类器的影响。据我们所知,尚无他人使用CTGAN生成合成样本来平衡入侵检测数据集。基于使用广泛使用的NSL-KDD数据集的大量实验,我们发现,与使用不平衡数据训练相同ML模型相比,使用CTGAN生成的合成样本平衡的数据集训练ML模型将预测准确率提高了至多。我们的实验还表明,一些在随机过采样平衡的数据上训练的ML模型的准确率,相比在相同不平衡数据上训练的ML模型有所下降。
引用
@article{arxiv.2204.00144,
title = {Effect of Balancing Data Using Synthetic Data on the Performance of Machine Learning Classifiers for Intrusion Detection in Computer Networks},
author = {Ayesha S. Dina and A. B. Siddique and D. Manivannan},
journal= {arXiv preprint arXiv:2204.00144},
year = {2022}
}