中文

Shell 或 无:面向自动渗透测试的实用基准与记忆激活智能体

密码学与安全 2025-09-16 v2

摘要

渗透测试是识别和缓解安全漏洞的关键手段,但传统方法仍然昂贵、耗时,且依赖专家人力。近期研究探索了 AI 驱动的渗透测试智能体,但其评估依赖于简化的夺旗(CTF)设置,这些设置嵌入先验知识、降低复杂度,导致性能估计远离实际应用场景。我们弥合了这一差距,引入首个面向实验室的、以智能体为导向的渗透测试基准——TermiBench,将目标从“寻找旗帜”转向“获得完全系统控制”。该基准涵盖 510 台主机、25 项服务和30个 CVE,具备真实环境,要求智能体自主侦察、区分良性与可利用服务,并执行可靠的漏洞利用。在现实条件下,我们发现现有系统几乎无法获得系统 shell。为此,我们提出了 TermiAgent——一个多智能体渗透测试框架。TermiAgent 通过 Located Memory Activation 机制缓解长时序记忆遗忘问题,通过结构化代码理解而非直接检索来构建可靠的漏洞利用工具库。在评估中,我们的方法在现有最先进智能体之上实现了卓越表现,展现出更强的渗透测试能力,缩短执行时间和成本,甚可在笔记本级硬件上部署实用。我们的工作为首个开源的实用自主渗透测试基准和首个创新性智能体框架,为 AI 驱动的渗透测试树立了里程碑。

关键词

引用

@article{arxiv.2509.09207,
  title  = {Shell or Nothing: Real-World Benchmarks and Memory-Activated Agents for Automated Penetration Testing},
  author = {Wuyuao Mai and Geng Hong and Qi Liu and Jinsong Chen and Jiarun Dai and Xudong Pan and Yuan Zhang and Min Yang},
  journal= {arXiv preprint arXiv:2509.09207},
  year   = {2025}
}