中文

自我欺骗:逆向穿透大语言模型的语义防火墙

计算与语言 2023-08-28 v2 人工智能 机器学习

摘要

大语言模型(LLM),如 ChatGPT,已展现出接近通用人工智能的惊人能力。在为各类社会需求提供便利的同时,LLM 也降低了生成有害内容的成本。因此,LLM 开发者已部署语义级防御以识别并拒绝可能导致不当内容的提示。遗憾的是,这些防御并非万无一失,一些攻击者精心构造了“越狱(jailbreak)”提示,暂时催眠 LLM 使其遗忘内容防御规则并回答任何不当问题。迄今,工业界与学术界对这些语义级攻击与防御背后的原理尚无清晰解释。本文研究 LLM 越狱问题并首次提出一种自动越狱方法。我们提出语义防火墙的概念并提供三种技术实现路径。受通过反向隧道穿透传统防火墙的攻击启发,我们引入一种“自我欺骗”攻击,可通过诱导 LLM 生成有助于越狱的提示来绕过语义防火墙。我们在七种虚拟场景下以六种语言(英语、俄语、法语、西班牙语、中文和阿拉伯语)共生成 2,520 个攻击载荷,针对三类最常见的违规类型:暴力、仇恨与色情。实验在 GPT-3.5-Turbo 与 GPT-4 两个模型上进行。两模型上的成功率分别为 86.2% 与 67%,失败率分别为 4.7% 与 2.2%。这凸显了所提攻击方法的有效性。所有实验代码与原始数据将开源以启发未来研究。我们相信,通过精心构造的提示来操控 AI 行为将成为未来重要的研究方向。

关键词

引用

@article{arxiv.2308.11521,
  title  = {Self-Deception: Reverse Penetrating the Semantic Firewall of Large Language Models},
  author = {Zhenhua Wang and Wei Xie and Kai Chen and Baosheng Wang and Zhiwen Gui and Enze Wang},
  journal= {arXiv preprint arXiv:2308.11521},
  year   = {2023}
}

备注

Serious errors were found in the experiment, which may lead to the overturning of the overall conclusions of the paper