中文

XGV-BERT:利用上下文语言模型与图神经网络实现高效软件漏洞检测

密码学与安全 2023-09-27 v1 人工智能

摘要

随着深度学习(DL)在各领域的进展,已有许多尝试通过数据驱动方法揭示软件漏洞。然而,现有此类工作缺乏能够有效保留源代码属性非顺序语义特征与上下文关系的表示。为此,本文提出 XGV-BERT,一种结合预训练 CodeBERT 模型与图神经网络(GCN)以检测软件漏洞的框架。通过在 XGV-BERT 内联合训练 CodeBERT 与 GCN 模块,所提模型利用大规模预训练的优势,借助图卷积学习训练数据的表示,从而驾驭海量原始数据与迁移学习。研究结果表明,与 VulDeePecker 和 SySeVR 等两种现有方法相比,XGV-BERT 方法显著提升了漏洞检测准确率。在 VulDeePecker 数据集上,XGV-BERT 取得了令人印象深刻的 97.5% F1 分数,显著优于取得 78.3% F1 分数的 VulDeePecker。同样,在 SySeVR 数据集上,XGV-BERT 取得 95.5% 的 F1 分数,超越了 F1 分数为 83.5% 的 SySeVR 结果。

关键词

引用

@article{arxiv.2309.14677,
  title  = {XGV-BERT: Leveraging Contextualized Language Model and Graph Neural Network for Efficient Software Vulnerability Detection},
  author = {Vu Le Anh Quan and Chau Thuan Phat and Kiet Van Nguyen and Phan The Duy and Van-Hau Pham},
  journal= {arXiv preprint arXiv:2309.14677},
  year   = {2023}
}