中文

CoopGuard:状态感知的协作代理保护大语言模型免受演化多轮攻击

密码学与安全 2026-04-07 v1 人工智能

摘要

随着大语言模型(LLMs)越来越多地部署在复杂应用中,其对对抗攻击的脆弱性引发了紧迫的安全关切,尤其是那些在多轮交互中不断演化的攻击。现有的防御方法大多是被动的,难以在对手跨轮次精炼策略时进行适应。在本工作中,我们提出了 CoopGuard,一个基于协作代理的状态感知多轮 LLM 防御框架,通过维护和更新内部防御状态来对抗演化攻击。它采用三种专用代理(延迟代理、诱惑代理和取证代理),由系统代理进行协调,系统代理根据演化防御状态(交互历史)调节决策并随时间编排代理。为评估演化威胁,我们引入了 EMRA 基准,包含 8 种攻击类型的 5,200 个对抗样本,模拟渐进式 LLM 多轮攻击。实验表明,CoopGuard 相比最先进的防御方法将攻击成功率降低了 78.9%,同时将欺骗率提高了 186%,将攻击效率降低了 167.9%,提供了对多轮防御更全面的评估。这些结果表明,CoopGuard 为 LLM 在多轮对抗场景中提供了鲁棒的保护。

关键词

引用

@article{arxiv.2604.04060,
  title  = {CoopGuard: Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Round Attacks},
  author = {Siyuan Li and Zehao Liu and Xi Lin and Qinghua Mao and Yuliang Chen and Haoyu Li and Jun Wu and Jianhua Li and Xiu Su},
  journal= {arXiv preprint arXiv:2604.04060},
  year   = {2026}
}