与 LLM 玩语言游戏导致越狱
计算与语言
2024-11-28 v2 人工智能
摘要
大型语言模型(LLM)的出现催生了众多旨在绕过其针对恶意攻击的安全防御的越狱技术。一种有效的越狱方法是找到安全泛化失效的领域,这种现象被称为泛化不匹配。在本文中,我们基于泛化不匹配引入了两种新颖的越狱方法:自然语言游戏和自定义语言游戏。这两种方法均能有效绕过 LLM 的安全机制,且种类繁多、变体各异,使其难以防御并导致高攻击成功率。自然语言游戏涉及使用合成语言结构及与这些结构交织的动作,例如 Ubbi Dubbi 语言。基于这一现象,我们提出了自定义语言游戏方法:通过使用各种自定义规则与 LLM 交互,我们成功在多个 LLM 平台上执行了越狱攻击。大量实验证明了我们方法的有效性,在 GPT-4o 上成功率达 93%,在 GPT-4o-mini 上达 89%,在 Claude-3.5-Sonnet 上达 83%。此外,为了研究安全对齐的泛化能力,我们使用自定义语言游戏对 Llama-3.1-70B 进行了微调,以在我们的数据集内实现安全对齐,结果发现当通过其他语言游戏进行交互时,微调后的模型仍无法识别有害内容。这一发现表明,嵌入在 LLM 中的安全对齐知识无法在不同语言格式之间泛化,从而为该领域的未来研究开辟了新途径。
引用
@article{arxiv.2411.12762,
title = {Playing Language Game with LLMs Leads to Jailbreaking},
author = {Yu Peng and Zewen Long and Fangming Dong and Congyi Li and Shu Wu and Kai Chen},
journal= {arXiv preprint arXiv:2411.12762},
year = {2024}
}