PocketAgents:面向自主防御代理的声明驱动库
密码学与安全
2026-05-22 v1 人工智能
摘要
将大型语言模型(LLM)连接到防御性强制措施,不仅仅是询问攻击是否正在发生。防御者必须决定哪些模型输出可能改变系统状态,哪些输出必须被拒绝,以及如何记录故障。我们提出PocketAgents,一个声明驱动的自主防御代理库。每个代理以三个数据文件形式安装:声明、提示和运行时上下文。共享的运行时为代理提供受限的遥测访问,仅接受类型化的报告且其请求的动作必须出现在声明中。我们在针对网络竞技场(Perry)上实现了PocketAgents,并在2025年5.21694号论文中评估了两个代理——命令与控制和数据外泄——在基于DarkSide风格攻击的小型企业拓扑结构的18次封闭环回试验中。13次试验产生了验证的网络阻断动作并遏制了攻击;4次失败了模式验证;1次产生了有效的无操作决定。实验表明,类型化边界使得LLM驱动的防御具有可衡量性、可扩展性和可归因性。
引用
@article{arxiv.2605.21694,
title = {PocketAgents: A Manifest-Driven Library of Autonomous Defense Agents},
author = {Sidnei Barbieri and Ágney Lopes Roth Ferraz and Lourenço Alves Pereira Júnior},
journal= {arXiv preprint arXiv:2605.21694},
year = {2026}
}