中文

利用代码的分词与路径表示识别安全相关提交

软件工程 2019-11-19 v1 计算与语言

摘要

CVE 和 NVD 等公共漏洞数据库仅涵盖开源项目中 60% 的安全漏洞,且已知存在质量不一致的问题。在过去两年中,NPM 和 Maven Central 等各类仓库中跨项目的已知漏洞数量大幅增长。这种日益增长的风险呼唤一种能够及时推断安全威胁存在机制的方案。我们提出了新颖的分层深度学习模型,用于从提交差异或 Java 类的源代码中对安全相关提交进行识别。通过将我们的模型与 code2vec(一种从代码基于路径的表示中学习的 SOTA 模型)以及逻辑回归基线进行比较,我们表明深度学习模型在识别安全相关提交方面展现出有前景的结果。我们还对不同深度学习模型如何跨不同输入表示进行学习,以及正则化对我们模型泛化能力的影响进行了比较分析。

关键词

引用

@article{arxiv.1911.07620,
  title  = {Exploiting Token and Path-based Representations of Code for Identifying Security-Relevant Commits},
  author = {Achyudh Ram and Ji Xin and Meiyappan Nagappan and Yaoliang Yu and Rocío Cabrera Lozoya and Antonino Sabetta and Jimmy Lin},
  journal= {arXiv preprint arXiv:1911.07620},
  year   = {2019}
}