中文

论述基于深度学习的现实数据集上漏洞检测性能

软件工程 2024-07-04 v1 人工智能 密码学与安全 机器学习

摘要

软件漏洞对日常软件系统的影响显著。尽管提出了深度学习模型用于漏洞检测,但其可靠性值得怀疑。先前的评估显示最高可达99%的召回率/F1分数,但在实际情境下表现不佳,尤其是在评估整个代码库而不仅仅是修复提交时。本文引入Real-Vul,一个代表现实场景的全面数据集,用于评估漏洞检测模型。评估DeepWukong、LineVul、ReVeal和IVDetect显示性能显著下降,精度下降最高可达95个百分点,F1分数下降最高可达91个百分点。此外,模型性能根据漏洞特征而波动,对信息泄露或代码注入的F1分数更高,对路径解析或可预测返回值漏洞的F1分数更低。结果突显了在实际应用中部署深度学习漏洞检测前需要解决的显著性能差距。我们识别出过拟合是关键问题,并提出一种数据增强技术,可能提升最高可达30%的性能。贡献包括更好的模型评估的数据集创建方法、Real-Vul数据集以及深入揭示深度学习模型在现实环境中挣扎的实证证据。

关键词

引用

@article{arxiv.2407.03093,
  title  = {Revisiting the Performance of Deep Learning-Based Vulnerability Detection on Realistic Datasets},
  author = {Partha Chakraborty and Krishna Kanth Arumugam and Mahmoud Alfadel and Meiyappan Nagappan and Shane McIntosh},
  journal= {arXiv preprint arXiv:2407.03093},
  year   = {2024}
}