中文

真实安全补丁的基准真值数据集

密码学与安全 2021-10-20 v1 软件工程

摘要

由于缺乏大规模数据集与真实数据,训练用于漏洞识别的机器学习方法并产出可靠工具以协助开发者实现无漏洞的优质软件颇具挑战。研究者一直关注这些问题并构建数据集。然而,这些数据集通常缺失自然语言产物与编程语言多样性。我们爬取了整个 CVE 详情数据库中的 GitHub 引用,并用 3 个安全相关数据集扩充了数据。我们利用这些数据创建了一个包含自然语言产物(如提交信息、提交评论与摘要)、元数据及代码变更的基准真值数据集。我们的数据集共整合了来自 1339 个不同项目的 8057 个安全相关提交——相当于 5942 个安全补丁——涵盖 146 种不同类型漏洞与 20 种语言。同时提供含 11 万非安全相关提交的数据集。数据与脚本均发布于 GitHub。数据存于 .CSV 文件,代码库可通过我们的脚本下载。我们的数据集是回答诸多研究问题的宝贵资产,例如利用 NLP 模型识别安全相关信息、软件工程与安全最佳实践、漏洞检测与修补,以及安全程序分析。

关键词

引用

@article{arxiv.2110.09635,
  title  = {A ground-truth dataset of real security patches},
  author = {Sofia Reis and Rui Abreu},
  journal= {arXiv preprint arXiv:2110.09635},
  year   = {2021}
}