中文

拼图游戏:拆分有害问题以越狱大型语言模型

计算与语言 2024-10-16 v1

摘要

大型语言模型(LLMs)在与人类互动和利用其庞大的隐式知识和强大的推理能力解决复杂问题方面表现出色。然而,此类模型容易受到越狱攻击,导致生成有害响应。尽管最近有关于单轮越狱策略的研究以促进防御机制的发展,但在多轮设置下揭示漏洞的挑战仍然相对未被充分探索。在这项工作中,我们提出了拼图游戏(JSP),一种针对先进LLMs的简单而有效的多轮越狱策略。JSP将问题拆分为无害的部分作为每轮的输入,并要求LLMs在多轮交互下重建并回答问题。我们的实验结果表明,所提出的JSP越狱绕过了针对明显有害内容的原始安全防护,在5个先进LLMs(Gemini-1.5-Pro、Llama-3.1-70B、GPT-4、GPT-4o、GPT-4o-mini)上对189个有害查询实现了平均93.76%的攻击成功率。此外,JSP在有害查询基准上对GPT-4实现了92%的最先进攻击成功率,并对防御策略表现出强大的抵抗力。警告:本文包含冒犯性示例。

关键词

引用

@article{arxiv.2410.11459,
  title  = {Jigsaw Puzzles: Splitting Harmful Questions to Jailbreak Large Language Models},
  author = {Hao Yang and Lizhen Qu and Ehsan Shareghi and Gholamreza Haffari},
  journal= {arXiv preprint arXiv:2410.11459},
  year   = {2024}
}