中文

OOG——用于表格类不平衡恶意软件数据的 Optuna 优化 GAN 采样技术

密码学与安全 2022-12-05 v1 机器学习

摘要

在现代技术时代,网络空间占据了人们生活的很大一部分,虽然有人善意地使用它,但也有人并非如此。恶意软件是一种其构建并非出于良性目的的应用程序,它可损害、窃取甚至篡改个人信息以及安全应用和软件。因此,有许多避免恶意软件的技术,其中之一是生成恶意软件样本,以便系统能随着恶意软件数量的增长而更新,从而在其试图入侵时加以识别。本研究使用生成对抗网络(Generative Adversarial Network, GAN)采样技术来生成新的恶意软件样本。GAN 有多种变体,要确定哪种变体对给定数据集样本最优,必须修改其参数。本研究采用自主超参数调优算法 Optuna 来确定所考虑数据集的最优设置。本文展示了 Optuna 优化 GAN(OOG)方法的架构,并给出了准确率、精确率、召回率和 F1 分数分别为 98.06%、99.00%、97.23% 和 98.04% 的分数。在调整五种监督提升算法 XGBoost、LightGBM、CatBoost、Extra Trees Classifier 和 Gradient Boosting Classifier 的超参数后,本文方法还采用加权集成技术来获得该结果。除比较该领域现有工作外,本研究还展示了 GAN 相较于 SMOTE 等其他采样技术的良好前景。

关键词

引用

@article{arxiv.2212.01274,
  title  = {OOG- Optuna Optimized GAN Sampling Technique for Tabular Imbalanced Malware Data},
  author = {S. M Towhidul Islam Tonmoy and S. M Mehedi Zaman},
  journal= {arXiv preprint arXiv:2212.01274},
  year   = {2022}
}

备注

Accepted for publication at 2022 IEEE International Conference on Big Data (IEEE BigData 2022)