中文

Haystack 中的越狱攻击

密码学与安全 2025-11-10 v1 人工智能 计算与语言 机器学习

摘要

近期长上下文语言模型(LM)的进展使得输入达到百万token,拓展了其在计算机使用智能体等复杂任务上的能力。然而,这些扩展上下文的安全性影响尚不明朗。为弥合这一差距,我们引入了NINJA(即Needle-in-haystack jailbreak attack),一种通过向有害用户目标后追加良性、由模型生成内容来越狱对齐模型的方法。我们方法的关键在于,发现有害目标的位置在安全性中发挥重要作用。实验在标准安全基准HarmBench上显示,NINJA在包括LLaMA、Qwen、Mistral和Gemini等最先进的开源和专有模型上,显著提升了攻击成功率。不同于先前的越狱方法,NINJA低资源、可迁移且难以检测。此外,我们展示NINJA是计算最优的——在固定计算预算下,增加上下文长度可优于增加最佳-N越狱中的试验次数。这些发现表明,即使是精心安排目标位置的良性长上下文,也会在现代LM中引入根本性漏洞。

关键词

引用

@article{arxiv.2511.04707,
  title  = {Jailbreaking in the Haystack},
  author = {Rishi Rajesh Shah and Chen Henry Wu and Shashwat Saxena and Ziqian Zhong and Alexander Robey and Aditi Raghunathan},
  journal= {arXiv preprint arXiv:2511.04707},
  year   = {2025}
}