SEDAC:一种基于 CVAE 的数据增强方法用于安全缺陷报告识别
密码学与安全
2024-01-23 v1 软件工程
摘要
缺陷跟踪系统存储了许多缺陷报告,其中一些与安全相关。识别这些安全缺陷报告(SBR)有助于我们预测某些安全相关缺陷并及时解决安全问题,从而使项目免受威胁和攻击。然而,在现实世界中,安全缺陷报告的比例极低;因此,直接使用原始数据训练预测模型可能导致结果不准确。面对数据不平衡的巨大挑战,过去许多研究者尝试使用文本过滤或聚类方法来最小化非安全缺陷报告(NSBR)的比例,或应用过采样方法合成 SBR,以使数据集尽可能平衡。尽管如此,这些方法仍面临两个挑战:1)它们忽略了长距离上下文信息。2)它们未能生成完全平衡的数据集。为解决这两个挑战,我们提出了 SEDAC,一种新的 SBR 识别方法,该方法生成相似的缺陷报告向量以解决数据不平衡问题并准确检测安全缺陷报告。与以往研究不同,它首先利用基于 word2vec 的 distilBERT 将缺陷报告转换为独立的缺陷报告向量。然后,通过条件变分自编码器(CVAE)训练一个生成模型,以生成带有安全标签的相似向量,从而使 SBR 的数量与 NSBR 的数量相等。最后,使用平衡后的数据训练一个安全缺陷报告分类器。为评估我们框架的有效性,我们在来自 Chromium 和四个 Apache 项目的 45,940 份缺陷报告上进行了实验。实验结果表明,SEDAC 在 g-measure 指标上优于所有基线方法,提升幅度约为 14.24%-50.10%。
引用
@article{arxiv.2401.12060,
title = {SEDAC: A CVAE-Based Data Augmentation Method for Security Bug Report Identification},
author = {Y. Liao and T. Zhang},
journal= {arXiv preprint arXiv:2401.12060},
year = {2024}
}
备注
11 pages, 3 figures