中文

软件漏洞预测模型的自动数据标签化:我们离这一步还有多远?

软件工程 2024-07-26 v1 密码学与安全 机器学习

摘要

背景:软件漏洞(SV)预测需要大规模且高质量的数据才能表现良好。当前的数据集大多需要由专家(人工标注)进行高成本的标注工作,从而受限于数据规模。与此同时,针对大规模自动SV标注的研究 efforts 正在增长,但自动标注数据是否适合SV预测仍然鲜有了解。目的:我们定量和定性地研究了最先进的自动标注SV数据(D2A)在SV预测中的质量和使用情况。方法:通过多个来源和手动验证,我们从两个著名项目中收集干净的SV数据,以探讨自动标注数据的对应情况。结果:我们发现超过50%的自动标注SV存在噪声(错误标注),且与公开报告的几乎不重叠。然而,利用这些噪声自动标注SV的SV预测模型在 Matthews 相关系数和召回率上分别比原始模型提升了最高可达22%和90%。我们还揭示了将噪声减少方法应用于自动标注SV数据以最大化数据利用的前景与困难。结论:我们的研究为使用自动标注SV及其挑战铺平了道路,为大规模SV预测提供了可能。

关键词

引用

@article{arxiv.2407.17803,
  title  = {Automatic Data Labeling for Software Vulnerability Prediction Models: How Far Are We?},
  author = {Triet H. M. Le and M. Ali Babar},
  journal= {arXiv preprint arXiv:2407.17803},
  year   = {2024}
}

备注

Accepted as a full paper in the technical track at The International Symposium on Empirical Software Engineering and Measurement (ESEM) 2024