PLAGUE:面向终身自适应生成多轮攻击的即插即用框架
密码学与安全
2025-10-23 v2 人工智能
计算与语言
机器学习
多智能体系统
摘要
大型语言模型(LLM)正在以卓越的速度提升。随着智能体工作流程的出现,多轮对话已成为与 LLM 完成长期和复杂任务交互的事实模式。尽管 LLM 能力不断提升,但在多轮情境下仍高度易受攻击,尤其是当有害意图可通过对话中逐步注入以产生恶意结果时。虽然单轮攻击已被广泛探索,但其多轮 counterparts 的可适应性、效率和有效性仍是关键挑战。为填补这一差距,我们提出 PLAGUE,一种受终身学习智能体启发的用于设计多轮攻击的新型即插即用框架。PLAGUE 将多轮攻击的生命周期细分为三个精心设计的阶段(Primer、Planner 和 Finisher),以系统性和信息丰富的方式探索多轮攻击族。评估表明,使用 PLAGUE 设计的红队智能体在更少或相当查询预算下,实现了在领先模型上的 state-of-the-art 恶意刷屏结果,攻击成功率(ASR)提高了 30% 以上。特别地,PLAGUE 在 OpenAI o3 和 Claude Opus 4.1 上的 ASR(基于 StrongReject)分别达到 81.4% 和 67.3%,这两种模型在安全文献中被认为是高度抗拒攻击的模型。我们的工作提供了工具和见解,以理解在构建针对多轮攻击的计划初始化、上下文优化和终身学习的重要性,进行全面模型漏洞评估。
引用
@article{arxiv.2510.17947,
title = {PLAGUE: Plug-and-play framework for Lifelong Adaptive Generation of Multi-turn Exploits},
author = {Neeladri Bhuiya and Madhav Aggarwal and Diptanshu Purwar},
journal= {arXiv preprint arXiv:2510.17947},
year = {2025}
}
备注
First two authors have equal author contributions