Dazzle:使用优化的生成对抗网络解决安全数据类不平衡问题
密码学与安全
2022-05-03 v2 机器学习
软件工程
摘要
背景:机器学习技术已被广泛使用,并在许多软件安全任务(如软件漏洞预测)中展现出有前景的性能。然而,软件漏洞数据集中的类比例通常高度不平衡(因为观测到漏洞的百分比通常非常低)。目标:帮助安全从业者解决软件安全数据类不平衡问题,并进一步借助重采样数据集构建更好的预测模型。方法:我们引入一种称为 Dazzle 的方法,它是带梯度惩罚的条件 Wasserstein 生成对抗网络(cWGAN-GP)的优化版本。Dazzle 通过一种称为贝叶斯优化的新型优化器探索 cWGAN-GP 的架构超参数。我们使用 Dazzle 生成少数类样本以对原始不平衡训练数据集进行重采样。结果:我们使用三个软件安全数据集(即 Moodle 漏洞文件、Ambari 缺陷报告和 JavaScript 函数代码)评估 Dazzle。我们表明 Dazzle 实用,并且相对于现有的最先进过采样技术(如 SMOTE)展现出有前景的改进(例如,在所有数据集中相对于 SMOTE 的召回率平均约有 60% 的改进率)。结论:基于本研究,我们建议将优化的 GAN 用作解决安全漏洞数据类不平衡问题的替代方法。
引用
@article{arxiv.2203.11410,
title = {Dazzle: Using Optimized Generative Adversarial Networks to Address Security Data Class Imbalance Issue},
author = {Rui Shu and Tianpei Xia and Laurie Williams and Tim Menzies},
journal= {arXiv preprint arXiv:2203.11410},
year = {2022}
}