中文

面向 Python 源代码漏洞检测的最优代码嵌入与机器学习分类器

软件工程 2025-09-17 v1

摘要

近年来,源代码的复杂性和规模使得手动软件漏洞检测变得日益不切实际。为应对这一挑战,利用机器学习和代码嵌入的自动化方法受到广泛关注。本研究探究了用于 Python 源代码漏洞检测的最优代码嵌入技术与机器学习分类器的组合。我们评估了三种嵌入技术,即 Word2Vec、CodeBERT 和 GraphCodeBERT,以及两种深度学习分类器,即双向长短期记忆网络(BiLSTM)和卷积神经网络(CNN)。虽然 CNN 与 GraphCodeBERT 的组合表现出强大的性能,但使用 Word2Vec 的 BiLSTM 模型在整体上始终实现了优异的结果。这些发现表明,尽管 CodeBERT 和 GraphCodeBERT 等近期模型拥有先进的架构,经典嵌入技术如 Word2Vec,配合序列模型如 BiLSTM,仍能提供略有但持续的性能优势。本研究强调了选择合适的嵌入和分类器组合以提高自动化漏洞检测系统效果的关键性,尤其是针对 Python 源代码。

关键词

引用

@article{arxiv.2509.13134,
  title  = {Optimizing Code Embeddings and ML Classifiers for Python Source Code Vulnerability Detection},
  author = {Talaya Farasat and Joachim Posegga},
  journal= {arXiv preprint arXiv:2509.13134},
  year   = {2025}
}