中文

FORGE:面向大规模智能合约漏洞数据集构建的 LLM 驱动框架

密码学与安全 2025-06-24 v1 软件工程

摘要

高质量的智能合约漏洞数据集对于评估安全工具和推动智能合约安全研究至关重要。当前手动构建数据集的两个主要局限性是(1)标记过程繁琐且容易出错,限制了数据集的规模、质量和演进;(2)缺乏标准化的分类规则导致不同数据集中漏洞类别和标记结果不一致。为此,我们提出了 FORGE,即首个用于构建智能合约漏洞数据集的自动化方法。FORGE 利用 LLM 驱动的管道从真实审计报告中提取高质量漏洞,并根据最广为人知的软件安全分类(CWE)进行分类。FORGE 采用分治策略从这些报告中提取结构化且自包含的漏洞信息。此外,它使用树状思维(tree-of-thoughts)技术将漏洞信息分类到分层的 CWE 分类中。为评估 FORGE 的效果,我们在 6,454 份真实审计报告上运行 FORGE,生成包含 81,390 个 Solidity 文件和 27,497 条漏洞发现的数据集,涵盖 296 个 CWE 类别。对数据集的手动评估显示,提取精度和分类一致性均与人类专家相当(精度为 95.6%,间谘系数 k-α 为 0.87)。我们进一步通过在数据集上对 13 个现有安全工具进行基准测试来验证数据集的实用性。结果揭示了当前检测能力的显著局限性。此外,通过统一的 CWE 视角分析数据集中的严重性-频率分布模式,我们凸显了当前智能合约研究关注点与来自真实世界漏洞的优先级之间的不一致。

关键词

引用

@article{arxiv.2506.18795,
  title  = {FORGE: An LLM-driven Framework for Large-Scale Smart Contract Vulnerability Dataset Construction},
  author = {Jiachi Chen and Yiming Shen and Jiashuo Zhang and Zihao Li and John Grundy and Zhenzhe Shao and Yanlin Wang and Jiashui Wang and Ting Chen and Zibin Zheng},
  journal= {arXiv preprint arXiv:2506.18795},
  year   = {2025}
}

备注

Accepted for the 48th International Conference on Software Engineering (ICSE 2026)