中文

利用生成技术扩充不平衡数据集中的网络攻击数据

机器学习 2019-12-11 v1 机器学习

摘要

机器学习技术有助于理解数据集的模式,以建立针对网络攻击的防御机制。然而,由于数据集中用于从整体数据集中区分攻击的样本不平衡,难以构建理论模型。多层感知机(MLP)技术将提高准确率并提升从平衡数据集中检测攻击与良性数据的性能。我们使用了公开可用的 UGR'16 数据集进行本工作。由于需从原始集合中准备测试集,已进行数据整理。我们以递增方式(即 10000、50000、100万)向神经网络分类器输入更大的数据,以观察特征在准确率上的分布。我们实现了一个 GAN 模型,能够生成不同攻击标签(例如黑名单、异常垃圾邮件、ssh扫描)的样本。我们已能根据从 UGR'16 取出的数据样本生成任意所需数量的样本。我们最初用不平衡数据集测试了模型的准确率,随后增加攻击样本进行测试,发现后者的分类性能有所提升。

关键词

引用

@article{arxiv.1912.04549,
  title  = {Expansion of Cyber Attack Data From Unbalanced Datasets Using Generative Techniques},
  author = {Ibrahim Yilmaz and Rahat Masum},
  journal= {arXiv preprint arXiv:1912.04549},
  year   = {2019}
}