中文

VADER:面向漏洞评估、检测、解释与修复的人工评估基准

密码学与安全 2025-05-27 v1 人工智能

摘要

确保大语言模型(LLM)能够有效评估、检测、解释和修复软件漏洞,对于构建稳健且安全的软件系统至关重要。我们引入了 VADER,这是一个经过人工评估的基准,旨在明确评估 LLM 在四个关键漏洞处理维度上的表现:评估、检测、解释和修复。VADER 包含 174 个真实世界的软件漏洞,每个漏洞均从 GitHub 代码库中精心挑选并由安全专家进行标注。对于每个漏洞案例,模型需要识别缺陷、使用通用缺陷枚举(CWE)对其进行分类、解释其根本原因、提出补丁并制定测试计划。我们采用单次提示(one-shot prompting)策略,在 VADER 上对六个最先进的 LLM(Claude 3.7 Sonnet、Gemini 2.5 Pro、GPT-4.1、GPT-4.5、Grok 3 Beta 和 o3)进行了基准测试,并由人类安全专家根据严格的评分标准对每个回答进行评估,该标准强调修复(代码修复质量,50%)、解释(20%)以及分类和测试计划(30%)。我们的结果表明,当前最先进的 LLM 在 VADER 上仅取得中等程度的成功率——OpenAI 的 o3 总体准确率达到 54.7%,其他模型在 49-54% 之间,表明仍有很大的改进空间。值得注意的是,修复质量与准确的分类和测试计划高度相关(Pearson r > 0.97),这表明能够有效分类漏洞的模型往往也能很好地修复它们。VADER 的综合数据集、详细评估标准、评分工具及带有置信区间的可视化结果均已公开发布,为社区提供了一个可解释、可复现的基准,以推动具备漏洞感知能力的 LLM 的发展。所有代码和数据可在以下地址获取:https://github.com/AfterQuery/vader

关键词

引用

@article{arxiv.2505.19395,
  title  = {VADER: A Human-Evaluated Benchmark for Vulnerability Assessment, Detection, Explanation, and Remediation},
  author = {Ethan TS. Liu and Austin Wang and Spencer Mateega and Carlos Georgescu and Danny Tang},
  journal= {arXiv preprint arXiv:2505.19395},
  year   = {2025}
}

备注

16 pages, 8 figures, 7 tables