针对LLM Jailbreaking的Agentic AI防御:动态Stackelberg博弈论框架
人工智能
2026-03-04 v2
摘要
本文提出一种博弈论框架,建模了提示工程师与大语言模型(LLM)之间的互动,作为两人广义形式博弈,内嵌Rapidly exploring Random Trees(RRT)搜索于提示空间。攻击者逐步抽样、扩展并测试提示,而LLM则选择接受、拒绝或重定向,导致Safe Interaction、Blocked或Jailbreak等终端结果。将RRT探索嵌入广义形式博弈中,既捕获了Jailbreak策略的发现阶段,也捕获了模型的战略响应。进一步,我们表明防御者行为可通过局部Stackelberg均衡条件加以解释,这解释了攻击者何时无法获得盈利的提示偏差,从而为Purple Agent防御提供了理论视角。最终的博弈树为评估、解释和强化LLM防御措施提供了原则性基础。
引用
@article{arxiv.2507.08207,
title = {Toward a Dynamic Stackelberg Game-Theoretic Framework for Agentic AI Defense Against LLM Jailbreaking},
author = {Zhengye Han and Quanyan Zhu},
journal= {arXiv preprint arXiv:2507.08207},
year = {2026}
}
备注
Accepted to ICLR 2026 AIMS Workshop. 13 pages, 3 figures