中文

AI攻击者对固定脆弱目标的可靠性:400次实证渗透测试一致性研究

密码学与安全 2026-05-29 v1 人工智能

摘要

大型语言模型(LLMs)可以自主开展多阶段网络攻击,但其在重复试验中的进攻行为一致性尚未得到研究。本工作呈现了LLM攻击一致性的首个大规模实证测量:400次自主渗透测试运行(4个模型,各100次),针对相同的陷阱主机(部署OWASP Juice Shop及两个额外脆弱服务),在提示词、 orchestrator 以及目标保持不变。在迭代0-1中,没有模型发出的任何内容拒绝响应能够通过 orchestrator 的一次性授权重提示生存。Claude Sonnet 4的API调用在上游服务不可用情况下遇到了问题——1,135次调用中有91次返回HTTP 529 overloaded_error,这发生在Anthropic容量事件期间的文档记录事件中,导致39次100次Claude运行被截断。尽管早期草案将这些列为安全拒绝;在完整日志审计后,它们是上游API故障,而非模型层面的拒绝。尽管如此,Claude在61次运行中实现了完全利用;Gemini 2.5 Flash-Lite在85次;GPT-4o-mini在56次,而部署了98个独特的攻击策略;qwen2.5-coder:14b在25次。不同模型的失败模式具有显著性:Claude通过API中断(39次运行),qwen通过提前完成(52次),GPT-4o-mini通过迭代预算耗尽(23次)。跨服务凭证复用仅在保留最多对话历史的配置中出现(qwen 57%,GPT-4o-mini 49%,云端模型在5次交换窗口内为0%)。跨模型利用率差异在统计上具有显著性(p < 0.001),效应规模较大;qwen与Gemini SQL注入率差异为Cohen's h = 1.12。首次利用时falls within 15-30秒的wall-clock范围内。鉴于本文是在N=100每个模型跨多服务目标上测量自主LLM攻击行为,这在我们所知中是首次研究。

关键词

引用

@article{arxiv.2605.30096,
  title  = {How Reliable Are AI Attackers Against a Fixed Vulnerable Target? A 400-Run Empirical Study of LLM Penetration Testing Consistency},
  author = {Galip Tolga Erdem},
  journal= {arXiv preprint arXiv:2605.30096},
  year   = {2026}
}

备注

41 pages, 7 figures. Code and 400-run dataset: https://doi.org/10.5281/zenodo.20421592