将恶意目标隐藏于良性文章中:通过载体文章越狱大型语言模型
密码学与安全
2025-02-10 v2 人工智能
摘要
大型语言模型(LLM)越狱是一种攻击,旨在绕过LLM的安全机制,生成违反其使用准则的内容。基于自注意力计算过程的洞察,本文提出了一种新颖的黑盒越狱方法,其核心思想是通过将禁止查询注入到一篇载体文章中,精心构造载荷提示。载体文章与禁止查询保持语义接近,它由从禁止查询生成的上位词文章和上下文自动组合而成。使用载体文章的直觉是激活模型中与禁止查询语义相关的神经元,同时抑制会触发有害文本生成的神经元。载体文章本身是良性的,我们利用提示注入技术来构造载荷提示。我们在JailbreakBench上评估了我们的方法,针对四个目标模型和100个不同的越狱目标进行了测试。实验结果表明,我们的方法具有显著的有效性,在目标模型上的平均成功率达到63%,明显优于现有的黑盒越狱方法。
引用
@article{arxiv.2408.11182,
title = {Hide Your Malicious Goal Into Benign Narratives: Jailbreak Large Language Models through Carrier Articles},
author = {Zhilong Wang and Haizhou Wang and Nanqing Luo and Lan Zhang and Xiaoyan Sun and Yebo Cao and Peng Liu},
journal= {arXiv preprint arXiv:2408.11182},
year = {2025}
}