Response Attack:利用上下文启动越狱大语言模型
计算与语言
2025-11-24 v2
摘要
上下文启动,即先前的刺激隐蔽地偏置后续判断,为大语言模型(LLM)提供了一个未被探索的攻击面。我们发现了一种上下文启动漏洞,其中对话中先前的响应可以引导其后续行为转向违反策略的内容。现有的越狱攻击主要依赖单轮或多轮提示操纵,或注入静态的上下文示例,这些方法存在有效性有限、效率低下或语义漂移等问题。我们引入了 Response Attack (RA),一个在对话中策略性地利用中间的、轻度有害的响应作为上下文启动器的新框架。通过重新表述有害查询并在发出目标触发提示之前注入这些中间响应,RA 利用了 LLM 中一个先前被忽视的漏洞。在八个 SOTA LLM 上的广泛实验表明,与九个领先的越狱基线相比,RA 始终取得显著更高的攻击成功率。我们的结果表明,RA 的成功直接归因于对中间响应的策略性使用,这诱导模型生成更明确和相关的有害内容,同时保持隐蔽性、效率以及对原始查询的忠实度。代码和数据可在 https://github.com/Dtc7w3PQ/Response-Attack 获取。
引用
@article{arxiv.2507.05248,
title = {Response Attack: Exploiting Contextual Priming to Jailbreak Large Language Models},
author = {Ziqi Miao and Lijun Li and Yuan Xiong and Zhenhua Liu and Pengyu Zhu and Jing Shao},
journal= {arXiv preprint arXiv:2507.05248},
year = {2025}
}
备注
20 pages, 10 figures. Code and data available at https://github.com/Dtc7w3PQ/Response-Attack