披着羊皮的狼:广义嵌套越狱提示可轻松欺骗大语言模型
计算与语言
2024-04-09 v4
摘要
大语言模型(LLMs),如 ChatGPT 和 GPT-4,旨在提供有用且安全的回复。然而,被称为“越狱”的对抗性提示可规避安全机制,导致 LLMs 生成潜在有害内容。探索越狱提示有助于更好地揭示 LLMs 的弱点,并进一步引导我们对其加以防护。遗憾的是,现有越狱方法要么受制于复杂的手动设计,要么需要在其他白盒模型上优化,从而牺牲了泛化性或效率。在本文中,我们将越狱提示攻击泛化为两个方面:(1)提示重写与(2)场景嵌套。基于此,我们提出 ReNeLLM,一个利用 LLMs 自身生成有效越狱提示的自动化框架。大量实验表明,与现有基线相比,ReNeLLM 显著提升了攻击成功率,同时大幅降低了时间成本。我们的研究也揭示了当前防御方法在保护 LLMs 方面的不足。最后,我们从提示执行优先级的角度分析了 LLMs 防御失败的原因,并提出了相应的防御策略。我们希望我们的研究能促使学术界与 LLMs 开发者共同提供更安全、更规范的 LLMs。代码见 https://github.com/NJUNLP/ReNeLLM。
引用
@article{arxiv.2311.08268,
title = {A Wolf in Sheep's Clothing: Generalized Nested Jailbreak Prompts can Fool Large Language Models Easily},
author = {Peng Ding and Jun Kuang and Dan Ma and Xuezhi Cao and Yunsen Xian and Jiajun Chen and Shujian Huang},
journal= {arXiv preprint arXiv:2311.08268},
year = {2024}
}
备注
Acccepted by NAACL 2024, 18 pages, 7 figures, 13 tables