Haystack 中的越狱攻击
密码学与安全
2025-11-10 v1 人工智能
计算与语言
机器学习
摘要
近期长上下文语言模型(LM)的进展使得输入达到百万token,拓展了其在计算机使用智能体等复杂任务上的能力。然而,这些扩展上下文的安全性影响尚不明朗。为弥合这一差距,我们引入了NINJA(即Needle-in-haystack jailbreak attack),一种通过向有害用户目标后追加良性、由模型生成内容来越狱对齐模型的方法。我们方法的关键在于,发现有害目标的位置在安全性中发挥重要作用。实验在标准安全基准HarmBench上显示,NINJA在包括LLaMA、Qwen、Mistral和Gemini等最先进的开源和专有模型上,显著提升了攻击成功率。不同于先前的越狱方法,NINJA低资源、可迁移且难以检测。此外,我们展示NINJA是计算最优的——在固定计算预算下,增加上下文长度可优于增加最佳-N越狱中的试验次数。这些发现表明,即使是精心安排目标位置的良性长上下文,也会在现代LM中引入根本性漏洞。
引用
@article{arxiv.2511.04707,
title = {Jailbreaking in the Haystack},
author = {Rishi Rajesh Shah and Chen Henry Wu and Shashwat Saxena and Ziqian Zhong and Alexander Robey and Aditi Raghunathan},
journal= {arXiv preprint arXiv:2511.04707},
year = {2025}
}