VulBERTa:用于漏洞检测的简化源代码预训练方法
密码学与安全
2023-06-21 v1 人工智能
机器学习
摘要
本文提出 VulBERTa,一种用于检测源代码中安全漏洞的深度学习方法。我们的方法使用自定义分词流水线在来自开源 C/C++ 项目的真实代码上预训练 RoBERTa 模型。该模型学习代码语法与语义的深度知识表示,我们借此训练漏洞检测分类器。我们在多个数据集(Vuldeepecker、Draper、REVEAL 和 muVuldeepecker)和基准(CodeXGLUE 和 D2A)上的二分类与多分类漏洞检测任务中评估了我们的方法。评估结果表明,尽管概念简单且在训练数据规模和模型参数数量上成本有限,VulBERTa 仍取得了最先进的性能,并在不同数据集上优于现有方法。
引用
@article{arxiv.2205.12424,
title = {VulBERTa: Simplified Source Code Pre-Training for Vulnerability Detection},
author = {Hazim Hanif and Sergio Maffeis},
journal= {arXiv preprint arXiv:2205.12424},
year = {2023}
}
备注
Accepted as a conference paper at IJCNN 2022