潜在漏洞是软件漏洞预测的隐藏宝藏吗?一项实证研究
软件工程
2024-01-23 v1 密码学与安全
机器学习
摘要
收集相关且高质量的数据是开发有效软件漏洞(SV)预测模型不可或缺的环节。当前大多数 SV 数据集依赖于修复 SV 的提交来提取漏洞函数和漏洞行。然而,这些数据集都没有考虑在所收集 SV 的引入和修复之间存在的潜在 SV。关于这些潜在 SV 对 SV 预测的有用性也知之甚少。为了填补这些空白,我们在两个常用的 SV 数据集上对潜在漏洞函数及其在函数级和行级 SV 预测中的利用进行了大规模研究。利用最先进的 SZZ 算法,我们在所研究的数据集中识别了超过 10 万个潜在漏洞函数。我们发现这些潜在函数平均可使 SV 数量增加 4 倍,并纠正多达 5 千个被错误标记的函数,尽管它们的噪声水平约为 6%。尽管存在噪声,我们证明了最先进的 SV 预测模型可以显著受益于此类潜在 SV。在函数级 SV 预测的性能(F1-Score)方面提高了 24.5%,在漏洞行定位的有效性方面提高了 67%。总体而言,我们的研究展示了利用潜在 SV 来提高 SV 数据集质量和增强 SV �测任务性能的首个有前景的步骤。
引用
@article{arxiv.2401.11105,
title = {Are Latent Vulnerabilities Hidden Gems for Software Vulnerability Prediction? An Empirical Study},
author = {Triet H. M. Le and Xiaoning Du and M. Ali Babar},
journal= {arXiv preprint arXiv:2401.11105},
year = {2024}
}
备注
Accepted as a full paper in the technical track at the 21st International Conference on Mining Software Repositories (MSR) 2024