中文

VulBERTa:用于漏洞检测的简化源代码预训练方法

密码学与安全 2023-06-21 v1 人工智能 机器学习

摘要

本文提出 VulBERTa,一种用于检测源代码中安全漏洞的深度学习方法。我们的方法使用自定义分词流水线在来自开源 C/C++ 项目的真实代码上预训练 RoBERTa 模型。该模型学习代码语法与语义的深度知识表示,我们借此训练漏洞检测分类器。我们在多个数据集(Vuldeepecker、Draper、REVEAL 和 muVuldeepecker)和基准(CodeXGLUE 和 D2A)上的二分类与多分类漏洞检测任务中评估了我们的方法。评估结果表明,尽管概念简单且在训练数据规模和模型参数数量上成本有限,VulBERTa 仍取得了最先进的性能,并在不同数据集上优于现有方法。

关键词

引用

@article{arxiv.2205.12424,
  title  = {VulBERTa: Simplified Source Code Pre-Training for Vulnerability Detection},
  author = {Hazim Hanif and Sergio Maffeis},
  journal= {arXiv preprint arXiv:2205.12424},
  year   = {2023}
}

备注

Accepted as a conference paper at IJCNN 2022