迈向改进的基于深度学习的漏洞检测
软件工程
2025-01-27 v2
摘要
深度学习 (DL) 已成为近期多种漏洞检测技术的共同主线。大量公开可用的漏洞数据集的出现推动了支撑这些技术的学习过程。虽然这些数据集有助于基于 DL 的漏洞检测器,但也限制了这些检测器的预测能力。这些数据集中的漏洞必须以特定方式表示,例如漏洞所在的代码行、函数或程序切片。我们将这种表示称为基本单元。检测器学习基本单元如何易受攻击,然后预测其他基本单元是否易受攻击。我们假设这种对单个基本单元的关注损害了检测器正确检测跨越多个基本单元(即 MBU 漏洞)的漏洞的能力。对于此类漏洞,只有当所有组成的基本单元都被检测为易受攻击时,才算正确检测。验证现有技术在检测漏洞所有部分方面的表现,对于确立其在其他下游任务中的有效性至关重要。为了评估我们的假设,我们进行了一项研究,重点关注三种主流的基于 DL 的检测器:ReVeal、DeepWukong 和 LineVul。我们的研究表明,这三种检测器各自的数据集中均包含 MBU 漏洞。此外,我们观察到在检测此类漏洞时准确率显著下降。我们展示了我们的研究以及一个可用于帮助基于 DL 的检测器正确纳入 MBU 漏洞的框架。
引用
@article{arxiv.2403.03024,
title = {Toward Improved Deep Learning-based Vulnerability Detection},
author = {Adriana Sejfia and Satyaki Das and Saad Shafiq and Nenad Medvidović},
journal= {arXiv preprint arXiv:2403.03024},
year = {2025}
}