SecureVibeBench:通过重构漏洞引入场景基准测试AI代理的安全编码
量子物理
2025-09-29 v1 量子气体
原子物理
摘要
由大语言模型驱动的代码代理正在快速改变软件工程,但其生成代码的安全风险已成为一个关键问题。现有基准测试提供了有价值的洞察,但它们未能捕捉到漏洞实际上由人类开发者引入的场景,使得人类与代理之间的公平比较无法进行。因此,我们引入了SecureVibeBench,一个包含105个C/C++安全编码任务的基准测试,任务来源于OSS-Fuzz中的41个项目。SecureVibeBench具有以下特点:(i)需要在大仓库中进行多文件编辑的真实任务设置,(ii)基于真实世界开源漏洞的对齐上下文,并精确识别漏洞引入点,以及(iii)结合功能测试和安全检查的全面评估,同时使用静态和动态预言机。我们在SecureVibeBench上评估了5个流行的代码代理(如OpenHands),它们由5个LLM(如Claude Sonnet 4.5)支持。结果表明,当前代理难以同时生成正确且安全的代码,即使表现最好的代理在SecureVibeBench上也仅产生了23.8%的正确且安全的解决方案。我们的代码和数据位于https://github.com/iCSawyer/SecureVibeBench。
引用
@article{arxiv.2509.22096,
title = {A Source of Deterministic Entanglement for Matter-Wave Networks},
author = {Chen Li and RuGway Wu and Jörg Schmiedmayer},
journal= {arXiv preprint arXiv:2509.22096},
year = {2025}
}