中文

针对LLM Jailbreaking的Agentic AI防御:动态Stackelberg博弈论框架

人工智能 2026-03-04 v2

摘要

本文提出一种博弈论框架,建模了提示工程师与大语言模型(LLM)之间的互动,作为两人广义形式博弈,内嵌Rapidly exploring Random Trees(RRT)搜索于提示空间。攻击者逐步抽样、扩展并测试提示,而LLM则选择接受、拒绝或重定向,导致Safe Interaction、Blocked或Jailbreak等终端结果。将RRT探索嵌入广义形式博弈中,既捕获了Jailbreak策略的发现阶段,也捕获了模型的战略响应。进一步,我们表明防御者行为可通过局部Stackelberg均衡条件加以解释,这解释了攻击者何时无法获得盈利的提示偏差,从而为Purple Agent防御提供了理论视角。最终的博弈树为评估、解释和强化LLM防御措施提供了原则性基础。

关键词

引用

@article{arxiv.2507.08207,
  title  = {Toward a Dynamic Stackelberg Game-Theoretic Framework for Agentic AI Defense Against LLM Jailbreaking},
  author = {Zhengye Han and Quanyan Zhu},
  journal= {arXiv preprint arXiv:2507.08207},
  year   = {2026}
}

备注

Accepted to ICLR 2026 AIMS Workshop. 13 pages, 3 figures