HonestCyberEval:用于自动化软件漏洞利用的AI网络风险基准
密码学与安全
2025-08-27 v3 人工智能
摘要
我们介绍HonestCyberEval,这是一个新的基准,用于评估AI模型在自动化软件漏洞利用中的能力与风险,聚焦于其检测和利用现实软件系统中漏洞的能力。我们的评估利用由人工合成漏洞构成的 Nginx Web 服务器存储库。我们评估了包括 OpenAI 的 GPT-4.5、o1-mini、o1 和 o1-mini、Anthropic 的 Claude-3-7-sonnet-20250219、Claude-3.5-sonnet-20241022 和 Claude-3.5-sonnet-20240620、Google DeepMind 的 Gemini-1.5-pro 以及 OpenAI 的早期 GPT-4o 在内的几种主流语言模型。我们的发现表明,这些模型在成功率和效率上存在显著差异,其中 o1-preview 实现了最高的成功率(92.85%),而 o3-mini 和 Claude-3.7-sonnet-20250219 则提供了具有成本效益但成功率较低的替代方案。本次风险评估为在真实网络攻击操作中系统性地评估AI网络风险奠定了基础。
引用
@article{arxiv.2410.21939,
title = {HonestCyberEval: An AI Cyber Risk Benchmark for Automated Software Exploitation},
author = {Dan Ristea and Vasilios Mavroudis},
journal= {arXiv preprint arXiv:2410.21939},
year = {2025}
}