漏洞代码意图概述数据集
软件工程
2025-04-14 v1
摘要
在大型语言模型 (LLM) 时代,代码概述技术取得了许多显著进展,但在计算机安全领域的代码概述潜力仍未得到充分探索。我们可以为代码片段生成其安全意图的代码概述吗?因此,本工作提出了一种创新的大规模多视角代码意图概述数据集,名为 BADS,旨在增强对给定代码片段的理解,并减少代码开发过程中的风险。建立数据集的步骤可分为四个步骤:首先,我们收集了来自多个来源的已知漏洞代码以及由人工智能生成的代码样本。其次,我们进行数据清洗和格式统一,然后进行数据合并。第三,我们利用 LLM 自动为代码片段添加注释。最后,我们进行人工评估进行双重检查。该数据集包含 X 个代码示例,覆盖 Y 类漏洞类别。我们的数据来源于 Z 个开源项目和 CVE 条目,与现有工作相比,我们的数据不仅包含原始代码,还包含代码功能概述和安全意图概述,为代码安全分析研究提供了上下文信息。所有信息均以 CSV 格式提供。本文的贡献包括四方面:建立高质量的多视角代码意图概述数据集;创新的数据收集和处理方法;提出一种新的多视角代码分析框架,推动软件工程和网络安全领域的跨学科研究;通过考虑现实应用中的代码长度限制,提高了研究成果的实用性和可扩展性。我们的数据集及相关工具已在 GitHub 上公开发布。
引用
@article{arxiv.2504.08180,
title = {A Vulnerability Code Intent Summary Dataset},
author = {Yifan Huang and Weisong Sun and Yubin Qu},
journal= {arXiv preprint arXiv:2504.08180},
year = {2025}
}