中文

通过利用生成过程对开源大语言模型进行灾难性越狱攻击

计算与语言 2023-10-12 v1 人工智能 密码学与安全

摘要

开源大语言模型(LLMs)的快速发展正显著推动人工智能的进步。在模型发布前,人们已做出大量努力将其行为与人类价值观对齐,主要目标是确保其有用且无害。然而,即便经过精心对齐的模型也可能被恶意操控,导致所谓“越狱”的意外行为。这类越狱通常由特定文本输入触发,常被称为对抗性提示。本工作中,我们提出生成利用攻击,一种仅通过操纵解码方法变体来破坏模型对齐的极简方法。通过利用不同的生成策略,包括改变解码超参数与采样方法,我们在 LLaMA2、Vicuna、Falcon 和 MPT 系列等 11 个语言模型上将未对齐率从 0% 提升至超过 95%,以 30×30\times 更低的计算成本优于当前最优攻击。最后,我们提出一种探索多样生成策略的有效对齐方法,可合理降低受我们攻击下的未对齐率。总之,本研究揭示了当前开源 LLM 安全评估与对齐程序的重大缺陷,强烈倡导在发布此类模型前进行更全面的红队测试与更好的对齐。我们的代码见 https://github.com/Princeton-SysML/Jailbreak_LLM。

关键词

引用

@article{arxiv.2310.06987,
  title  = {Catastrophic Jailbreak of Open-source LLMs via Exploiting Generation},
  author = {Yangsibo Huang and Samyak Gupta and Mengzhou Xia and Kai Li and Danqi Chen},
  journal= {arXiv preprint arXiv:2310.06987},
  year   = {2023}
}