中文

通过语义保持数据增强提升预训练语言模型在漏洞检测中的性能

密码学与安全 2024-10-04 v2 软件工程

摘要

随着先进网络系统的快速发展和广泛应用,软件漏洞对安全通信和网络安全构成重大威胁。基于学习的漏洞检测系统,特别是利用预训练语言模型的系统,已在及时识别通信网络中的漏洞并降低被利用风险方面展现出巨大潜力。然而,准确标注的漏洞数据集短缺限制了该领域的进一步发展。现有数据增强方法未能代表现实世界漏洞数据的多样性,亦未能保持漏洞语义,导致其对模型训练贡献有限甚至适得其反。本文提出一种数据增强技术,旨在提高预训练语言模型在漏洞检测任务中的性能。该方法对给定漏洞数据集进行自然语义保持程序转换,生成大量新样本,丰富数据多样性和多样性。通过将增强后数据集用于微调一系列代表性代码预训练模型(如 CodeBERT、GraphCodeBERT、UnixCoder 和 PDBERT),在漏洞检测任务中可实现准确率提升最高达 10.1%,F1 分数提升最高达 23.6%。比较结果表明,我们的方法在多个知名漏洞增强方法中均显著优于他人。

关键词

引用

@article{arxiv.2410.00249,
  title  = {Enhancing Pre-Trained Language Models for Vulnerability Detection via Semantic-Preserving Data Augmentation},
  author = {Weiliang Qi and Jiahao Cao and Darsh Poddar and Sophia Li and Xinda Wang},
  journal= {arXiv preprint arXiv:2410.00249},
  year   = {2024}
}

备注

Accepted by EAI International Conference on Security and Privacy in Communication Networks (SecureComm 2024)