中文

灾难性网络安全能力基准(3CB):对 LLM Agent 网络攻击能力的稳健评估

密码学与安全 2024-11-05 v2 人工智能 机器学习 性能

摘要

大语言模型(LLM)代理有潜力在防御性网络安全操作中实现突破,但其攻击能力尚未完全理解。为此,模型开发者和政府机构正在评估基础模型的网络安全能力。然而,这些评估往往缺乏透明度和对攻击能力的全面关注。为此,我们提出了灾难性网络安全能力基准(Catastrophic Cyber Capabilities Benchmark, 3CB),这是一个新颖的框架,旨在严格评估大语言模型代理的实际攻击能力。我们在 3CB 上对现代大语言模型进行评估,发现面向前沿的模型(如 GPT-4o 和 Claude 3.5 Sonnet)可以在从二进制分析到 web 技术的各个领域执行侦察和利用等攻击任务。相比之下,较小的开源模型表现出有限的攻击能力。我们的软件解决方案及相应的基准测试为缩小快速提升的能力与网络安全攻击评估稳健性之间的差距提供了关键工具,助力更安全地部署和监管这些强大技术。

关键词

引用

@article{arxiv.2410.09114,
  title  = {Catastrophic Cyber Capabilities Benchmark (3CB): Robustly Evaluating LLM Agent Cyber Offense Capabilities},
  author = {Andrey Anurin and Jonathan Ng and Kibo Schaffer and Jason Schreiber and Esben Kran},
  journal= {arXiv preprint arXiv:2410.09114},
  year   = {2024}
}

备注

https://cybercapabilities.org/