生存则需背叛:基于博弈论情景的大语言模型劫持攻击
密码学与安全
2025-11-21 v1 人工智能
摘要
随着大语言模型(LLM)的普及,非专业用户可能构成风险,促使了关于劫持攻击的广泛研究。然而,现有大多数黑箱劫持攻击依赖手工制作的启发式方法或狭窄的搜索空间,限制了可扩展性。与现有攻击相比,我们提出了基于博弈论的攻击(Game-Theory Attack, GTA),是一个可扩展的黑箱劫持框架。具体而言,我们将攻击者与安全对齐的LLM的互动形式化为一个有限时域、可提前终止的序列随机博弈,并通过量化响应(quantal response)重新参数化LLM的随机输出。基于此,我们引入一种行为猜想“模板-安全翻转”:通过博弈论情景重新塑造LLM的有效目标,原本的安全偏好可能在特定情景下转化为最大化情景收益,从而削弱特定情境下的安全约束。我们通过揭露式囚徒困境等经典博弈验证了此机制,并进一步引入攻击者代理(Attacker Agent),通过自适应施加压力来提高成功攻击率(ASR)。在多个协议和数据集上的实验表明,GTA在Deepseek-R1等LLM上实现超过95%的ASR,同时保持高效。对组件、解码、多语言设置以及代理核心模型的消融实验确认了其有效性和普适性。此外,情景规模研究进一步证明了其可扩展性。GTA还在其他博弈论情景和一种即时生成的LLM变体中取得高ASR,该变体在保持模型机制不变的同时变化背景情境,实现可 comparable 的ASR。配合执行词级插入的有害词检测代理(Harmful-Words Detection Agent),GTA在保持高ASR的同时降低了基于提示守卫模型的检测。除基准测试外,GTA还劫持了实际的LLM应用,并对流行的HuggingFace LLMs进行了纵向安全监控。
引用
@article{arxiv.2511.16278,
title = {"To Survive, I Must Defect": Jailbreaking LLMs via the Game-Theory Scenarios},
author = {Zhen Sun and Zongmin Zhang and Deqi Liang and Han Sun and Yule Liu and Yun Shen and Xiangshan Gao and Yilong Yang and Shuai Liu and Yutao Yue and Xinlei He},
journal= {arXiv preprint arXiv:2511.16278},
year = {2025}
}
备注
20 pages