中文

PAL:面向大型语言模型的代理引导黑盒攻击

计算与语言 2024-02-16 v1 人工智能 密码学与安全 机器学习

摘要

大型语言模型(LLM)近几个月来迅速流行,但它们已展现出在被操控时生成有害内容的令人担忧的能力。虽然安全微调等技术旨在减少有害使用,但最近的研究表明,LLM仍然容易受到引发毒性响应的攻击。在这项工作中,我们引入了面向LLM的代理引导攻击(PAL),这是首个在黑盒仅查询设置下针对LLM的基于优化的攻击。具体而言,它依赖于一个代理模型来指导优化,以及一个为真实世界LLM API设计的复杂损失函数。我们的攻击在GPT-3.5-Turbo上达到了84%的攻击成功率(ASR),在Llama-2-7B上达到了48%,而当前最先进的方法仅为4%。我们还提出了GCG++,这是对GCG攻击的改进,在白盒Llama-2-7B上达到了94%的ASR,以及面向LLM的随机搜索攻击(RAL),这是一种强大但简单的基于查询的攻击基线。我们相信,本文提出的技术将能够对LLM进行更全面的安全测试,并从长远来看,有助于开发更好的安全护栏。代码可在https://github.com/chawins/pal获取。

关键词

引用

@article{arxiv.2402.09674,
  title  = {PAL: Proxy-Guided Black-Box Attack on Large Language Models},
  author = {Chawin Sitawarin and Norman Mu and David Wagner and Alexandre Araujo},
  journal= {arXiv preprint arXiv:2402.09674},
  year   = {2024}
}