全在于如何提问:一种简单的黑盒越狱攻击方法
计算与语言
2024-04-25 v3 人工智能
计算机与社会
摘要
大型语言模型(LLM),如 ChatGPT,面临“越狱”挑战,即其安全防护被绕过以生成违背伦理的有害提示。本研究提出了一种简单的黑盒方法,用于高效构造越狱提示,以解决传统方法面临的显著复杂性和计算成本问题。我们的技术直接利用目标 LLM,将有害提示迭代转换为良性表达,其前提假设是 LLM 能够自主生成规避安全防护的表达。通过在 ChatGPT(GPT-3.5 和 GPT-4)以及 Gemini-Pro 上进行的实验,对于违禁问题,我们的方法在平均五次迭代内持续实现了超过 80% 的攻击成功率,并且对模型更新表现出鲁棒性。生成的越狱提示不仅措辞自然、简洁,而且难以防御。这些发现表明,构造有效的越狱提示并不像以前认为的那样复杂,凸显了黑盒越狱攻击所带来的更高风险。
引用
@article{arxiv.2401.09798,
title = {All in How You Ask for It: Simple Black-Box Method for Jailbreak Attacks},
author = {Kazuhiro Takemoto},
journal= {arXiv preprint arXiv:2401.09798},
year = {2024}
}
备注
12 pages, 4 figures, 3 tables