真实世界渗透测试中AI代理与网络安全专业人员的比较
人工智能
2026-03-04 v2 密码学与安全
计算机与社会
摘要
我们首次对AI代理与人类网络安全专业人员在真实企业环境中的表现进行了全面评估。我们评估了10名网络安全专业人员以及6个现有AI代理和我们新的代理框架ARTEMIS,评估对象为一个包含约8,000台主机、跨越12个子网的大型大学网络。ARTEMIS是一个多代理框架,具备动态提示生成、任意子代理和自动漏洞分类功能。在我们的对比研究中,ARTEMIS总体排名第二,发现了9个有效漏洞,有效提交率为82%,优于10名人类参与者中的9名。尽管Codex和CyAgent等现有框架相对于大多数人类参与者表现不佳,但ARTEMIS展现出与最强参与者相当的技术成熟度和提交质量。我们观察到AI代理在系统性枚举、并行利用和成本方面具有优势——ARTEMIS的某些变体成本为每小时18美元,而专业渗透测试人员为每小时60美元。我们还识别出关键的能力差距:AI代理的误报率更高,在基于图形用户界面的任务上表现不佳。
引用
@article{arxiv.2512.09882,
title = {Comparing AI Agents to Cybersecurity Professionals in Real-World Penetration Testing},
author = {Justin W. Lin and Eliot Krzysztof Jones and Donovan Julian Jasper and Ethan Jun-shen Ho and Anna Wu and Arnold Tianyi Yang and Neil Perry and Andy Zou and Matt Fredrikson and J. Zico Kolter and Percy Liang and Dan Boneh and Daniel E. Ho},
journal= {arXiv preprint arXiv:2512.09882},
year = {2026}
}