前沿大语言模型是否准备好用于网络安全?基于双模式漏洞基准的垂直领域模型证据
密码学与安全
2026-05-25 v1 人工智能
摘要
我们通过双模式基准评估前沿大语言模型(LLM)是否准备好用于网络安全:白盒函数级漏洞检测(VulnLLM-R,覆盖 C/Java/Python)和黑盒 Web 应用安全测试(五个生产级应用,包含 118 个真实漏洞,覆盖 20+ 个 CWE 家族,这些漏洞将公开源码)。我们测试了六个前沿模型(GPT-5.4、Codex~5.3、Claude Opus~4.6、Sonnet~4.6、Gemini~3.1~Pro 和 Gemini~3~Flash)和两个领域专用模型,涵盖四种测试范式。我们的发现令人警惕:(1)每个前沿模型在白盒检测中都产生 10-50% 的假阳性率,系统性地高估漏洞;(2)在黑盒测试中,前沿模型仅覆盖 4-8% 的真实漏洞,即使配合外部安全工具(Playwright MCP、Burp Suite MCP)也仅提升至 10-19%;(3)结构化渗透测试方法编码于领域专用智能体后,单一 CWE 家族的检测率可超过 50%,表明方法而非规模是主要驱动因素;(4)领域专用防御模型在所有模型中实现最高的精度(0.904)和最低的假阳性率(9.7%),仅用单张 GPU 即可实现。我们识别出缺乏端到端请求/响应序列、以失败为主的数据以及多步骤攻击链作为根本性训练数据瓶颈,并提出自我对弈安全测试作为数据生成策略。我们的结果支持为网络安全构建垂直领域模型的论点。
引用
@article{arxiv.2605.23243,
title = {Are Frontier LLMs Ready for Cybersecurity? Evidence for Vertical Foundation Models from Dual-Mode Vulnerability Benchmarks},
author = {Vivek Dahiya and Sunny Nehra and Vipul Dholariya and Bhavik Shangari and Chandra Khatri},
journal= {arXiv preprint arXiv:2605.23243},
year = {2026}
}