Na'vi 或 Knave:通过隐喻化身越狱语言模型
计算与语言
2025-02-25 v4 人工智能
摘要
隐喻作为一种传递信息的隐式方法,能够实现对复杂主题的泛化理解。然而,隐喻可能被利用来绕过大语言模型的安全对齐机制,导致有害知识的窃取。在我们的研究中,我们引入了一种新颖的攻击框架,该框架利用 LLM 的想象力能力来实现越狱,即通过对抗性隐喻进行越狱(J\underline{\textbf{A}}ilbreak \underline{\textbf{V}}ia \underline{\textbf{A}}dversarial Me\underline{\textbf{TA}} -pho\underline{\textbf{R}},\textit{AVATAR})。具体而言,为了引出有害响应,AVATAR 从给定的有害目标中提取有害实体,并基于 LLM 的想象力将其映射到无害的对抗性实体。然后,根据这些隐喻,将有害目标自适应地嵌套在类人交互中以进行越狱。实验结果表明,AVATAR 能够有效且可迁移地越狱 LLM,并在多个先进的 LLM 上实现了最先进的攻击成功率。我们的研究揭示了 LLM 因其内生想象力能力而面临的安全风险。此外,分析研究揭示了 LLM 对对抗性隐喻的脆弱性,以及开发针对由对抗性隐喻引起的越狱的防御方法的必要性。\textcolor{orange}{ \textbf{警告:本文包含来自 LLM 的潜在有害内容。}}
引用
@article{arxiv.2412.12145,
title = {Na'vi or Knave: Jailbreaking Language Models via Metaphorical Avatars},
author = {Yu Yan and Sheng Sun and Junqi Tong and Min Liu and Qi Li},
journal= {arXiv preprint arXiv:2412.12145},
year = {2025}
}
备注
Our study requires further in-depth research to ensure the comprehensiveness and adequacy of the methodology