深入剖析:从实用视角重审基于深度学习的漏洞检测器
软件工程
2025-07-15 v1
摘要
随着软件漏洞威胁的不断增长,基于深度学习(DL)的检测器因漏洞检测而受到青睐。然而,关于其在声明的 CWE 范围内的一致性、现实世界有效性以及跨场景的适用性仍存疑虑。这些问题可能导致检测不可靠、误报/漏报率高以及对新兴漏洞的适应性差。亟需进行全面分析以揭示影响检测的关键因素,并指导模型设计和部署的改进。在本文中,我们提出了 VulTegra,一个用于漏洞检测中对 scratch 训练模型和预训练模型进行多维比较的新型评估框架。VulTegra 揭示了当前最先进(SOTA)检测器仍面临低一致性、有限现实能力以及可扩展性挑战。与普遍认知相反,预训练模型并不一定在所有情况下都优于 scratch 训练模型,但在特定情境中表现出不同且独特的优势。重要的是,我们的研究暴露了仅依赖 CWE 分类的局限性,并识别了显著影响模型性能的关键因素。实验结果表明,仅调整其中一个因素即可在所有七个被评估的检测器中实现召回率的持续性提升,其中六个还能获得更好的 F1 分数。我们的发现提供了更深入的模型行为洞察,强调需同时考虑漏洞类型和固有的编码特征才能实现有效检测。
引用
@article{arxiv.2507.09529,
title = {It Only Gets Worse: Revisiting DL-Based Vulnerability Detectors from a Practical Perspective},
author = {Yunqian Wang and Xiaohong Li and Yao Zhang and Yuekang Li and Zhiping Zhou and Ruitao Feng},
journal= {arXiv preprint arXiv:2507.09529},
year = {2025}
}