中文

全在于如何提问:一种简单的黑盒越狱攻击方法

计算与语言 2024-04-25 v3 人工智能 计算机与社会

摘要

大型语言模型(LLM),如 ChatGPT,面临“越狱”挑战,即其安全防护被绕过以生成违背伦理的有害提示。本研究提出了一种简单的黑盒方法,用于高效构造越狱提示,以解决传统方法面临的显著复杂性和计算成本问题。我们的技术直接利用目标 LLM,将有害提示迭代转换为良性表达,其前提假设是 LLM 能够自主生成规避安全防护的表达。通过在 ChatGPT(GPT-3.5 和 GPT-4)以及 Gemini-Pro 上进行的实验,对于违禁问题,我们的方法在平均五次迭代内持续实现了超过 80% 的攻击成功率,并且对模型更新表现出鲁棒性。生成的越狱提示不仅措辞自然、简洁,而且难以防御。这些发现表明,构造有效的越狱提示并不像以前认为的那样复杂,凸显了黑盒越狱攻击所带来的更高风险。

关键词

引用

@article{arxiv.2401.09798,
  title  = {All in How You Ask for It: Simple Black-Box Method for Jailbreak Attacks},
  author = {Kazuhiro Takemoto},
  journal= {arXiv preprint arXiv:2401.09798},
  year   = {2024}
}

备注

12 pages, 4 figures, 3 tables