中文

你懂我的意思:通过隐式引用的越狱攻击

计算与语言 2024-10-10 v2

摘要

尽管近期大型语言模型(LLM)对齐技术的进步使得涉及场景嵌套和关键词重写的恶意目标能够被有效识别,但我们的研究表明,这些方法在检测通过嵌套在无害目标中的上下文所表达的恶意目标方面仍然不足。本研究识别出一个先前被忽视的漏洞,我们称之为“通过隐式引用的攻击”(AIR)。AIR将一个恶意目标分解为多个可允许的目标,并通过上下文中的隐式引用将它们联系起来。该方法利用多个相关的无害目标生成恶意内容,而不会触发拒绝响应,从而有效绕过现有的检测技术。我们的实验证明了AIR在多个最先进的LLM上的有效性,在包括GPT-4o、Claude-3.5-Sonnet和Qwen-2-72B在内的大多数模型上实现了超过90%的攻击成功率(ASR)。值得注意的是,我们观察到一种逆缩放现象,即更大的模型更容易受到这种攻击方法的影响。这些发现凸显了迫切需要能够理解和预防上下文攻击的防御机制。此外,我们引入了一种跨模型攻击策略,利用安全性较低的模型生成恶意上下文,从而在针对其他模型时进一步提高ASR。我们的代码和越狱工件可在https://github.com/Lucas-TY/llm_Implicit_reference获取。

关键词

引用

@article{arxiv.2410.03857,
  title  = {You Know What I'm Saying: Jailbreak Attack via Implicit Reference},
  author = {Tianyu Wu and Lingrui Mei and Ruibin Yuan and Lujun Li and Wei Xue and Yike Guo},
  journal= {arXiv preprint arXiv:2410.03857},
  year   = {2024}
}