中文

SQL 注入越狱:大语言模型的结构性灾难

密码学与安全 2025-05-22 v6

摘要

大语言模型(LLM)容易受到越狱攻击,这些攻击可诱导其生成有害内容。先前的越狱方法主要利用 LLM 的内部属性或能力,例如基于优化的越狱方法和利用模型上下文学习能力的方法。在本文中,我们提出了一种新型越狱方法——SQL 注入越狱(SIJ),该方法针对 LLM 的外部属性,具体而言是 LLM 构建输入提示的方式。通过将越狱信息注入用户提示,SIJ 成功诱导模型输出有害内容。对于开源模型,SIJ 在 AdvBench 和 HEx-PHI 上的五个知名 LLM 上实现了接近 100% 的攻击成功率,同时相较于先前方法具有更低的时间成本。对于闭源模型,SIJ 在 GPT 和 Doubao 系列五个模型上的平均攻击成功率超过 85%。此外,SIJ 暴露了 LLM 中一种亟需缓解的新漏洞。为应对这一问题,我们提出了一种简单的自适应防御方法 Self-Reminder-Key 以对抗 SIJ,并通过实验结果证明了其有效性。我们的代码可在 https://github.com/weiyezhimeng/SQL-Injection-Jailbreak 获取。

关键词

引用

@article{arxiv.2411.01565,
  title  = {SQL Injection Jailbreak: A Structural Disaster of Large Language Models},
  author = {Jiawei Zhao and Kejiang Chen and Weiming Zhang and Nenghai Yu},
  journal= {arXiv preprint arXiv:2411.01565},
  year   = {2025}
}

备注

Accepted by findings of ACL 2025