数据泄露对基于深度学习模型检测提升代码漏洞定位影响
密码学与安全
2025-12-29 v2 计算与语言
机器学习
软件工程
摘要
本研究考察了数据泄露对用于检测提升代码中漏洞的神经网络的影响,并建基于之前的研究,使用 word2vec 和单向和双向基于转换器的嵌入。研究特别关注当嵌入模型使用包含用于神经网络训练和验证的样本的数据集进行训练时,模型性能如何受到影响。结果表明,引入数据泄露并未显著改变模型性能,这表明数据泄露影响最小,或者作为方法论的一部分随机丢弃的样本包含实现最佳性能所必需的隐藏特征。此外,研究发现 reinforces 先前研究的结论,即使用 GPT-2 嵌入训练的模型在性能上一致优于使用其他嵌入训练的神经网络。即使在数据泄露被引入嵌入模型的情况下,这一点也成立,这表明 GPT-2 在表示复杂代码特征方面具有鲁棒性,即使在不理想条件下也能做好。
引用
@article{arxiv.2412.02048,
title = {Impact of Data Snooping on Deep Learning Models for Locating Vulnerabilities in Lifted Code},
author = {Gary A. McCully and John D. Hastings and Shengjie Xu},
journal= {arXiv preprint arXiv:2412.02048},
year = {2025}
}
备注
7 pages, 2 figures