StagedVulBERT: 基于新型预训练代码模型的多粒度漏洞检测
密码学与安全
2024-10-10 v1 软件工程
摘要
基于预训练模型的漏洞检测方法的出现显著推动了自动化漏洞检测领域的发展。然而,这些方法仍面临若干挑战,例如难以学习语句的有效特征表示以实现细粒度预测,以及难以处理过长的代码序列。为解决这些问题,本研究引入了StagedVulBERT,一种新颖的漏洞检测框架,它利用预训练的代码语言模型并采用从粗到细的策略。我们研究的关键创新和贡献在于框架内开发的CodeBERT-HLS组件,该组件专门用于分层、层次化和语义编码。该组件旨在同时捕获令牌级和语句级的语义,这对于实现更准确的多粒度漏洞检测至关重要。此外,CodeBERT-HLS能高效处理更长的代码令牌序列,使其更适合现实世界的漏洞检测。综合实验表明,我们的方法在粗粒度和细粒度两个层面上均提升了漏洞检测的性能。具体而言,在粗粒度漏洞检测中,StagedVulBERT达到了92.26%的F1分数,比最佳方法提高了6.58%。在细粒度层面,我们的方法达到了65.69%的Top-5%准确率,比最先进的方法高出75.17%。
引用
@article{arxiv.2410.05766,
title = {StagedVulBERT: Multi-Granular Vulnerability Detection with a Novel Pre-trained Code Model},
author = {Yuan Jiang and Yujian Zhang and Xiaohong Su and Christoph Treude and Tiantian Wang},
journal= {arXiv preprint arXiv:2410.05766},
year = {2024}
}
备注
18 pages,13 figures