中文

使其提问并回答:通过伪装与重构在少量查询中越狱大型语言模型

密码学与安全 2024-06-11 v2 人工智能

摘要

近年来,大型语言模型(LLMs)在各种任务中表现出显著的成功,但 LLMs 的可信度仍然是一个未决问题。其中一个具体威胁是生成有毒或有害响应的可能性。攻击者可以构造对抗性提示,诱导 LLMs 产生有害响应。在本工作中,我们通过识别安全微调中的偏差漏洞,开创了 LLMs 安全的理论基础,并设计了一种名为 DRA(Disguise and Reconstruction Attack,伪装与重构攻击)的黑盒越狱方法,该方法通过伪装隐藏有害指令,并提示模型在其完成内容中重构原始的有害指令。我们在各种开源和闭源模型上评估了 DRA,展示了最先进的越狱成功率和攻击效率。值得注意的是,DRA 在 OpenAI GPT-4 聊天机器人上取得了 91.1% 的攻击成功率。

关键词

引用

@article{arxiv.2402.18104,
  title  = {Making Them Ask and Answer: Jailbreaking Large Language Models in Few Queries via Disguise and Reconstruction},
  author = {Tong Liu and Yingjie Zhang and Zhe Zhao and Yinpeng Dong and Guozhu Meng and Kai Chen},
  journal= {arXiv preprint arXiv:2402.18104},
  year   = {2024}
}