中文

面向目标的大语言模型提示攻击与安全性评估

计算与语言 2023-12-11 v2

摘要

大语言模型(LLMs)在文本理解与生成方面展现出显著优势。然而,LLMs 尤其在被部署于应用时,存在生成有害内容的风险。已有若干黑盒攻击方法,如提示攻击(Prompt Attack),可改变 LLMs 的行为并诱导其生成含有害内容的意外回答。研究者对 LLMs 的提示攻击与防御感兴趣,但目前尚无公开可用且具高攻击成功率的数据集来评估防御提示攻击的能力。本文引入一种构建高质量提示攻击样本的流水线,以及名为 CPAD 的中文提示攻击数据集。我们的提示旨在通过若干精心设计的提示攻击模板与广受关注的攻击内容,诱导 LLMs 生成意外输出。与以往涉及安全性评估的数据集不同,我们从内容、攻击方法与目标三个维度构建提示。特别地,攻击目标指明了成功攻击 LLMs 后期望的行为,从而响应可被轻松评估与分析。我们在数据集上运行若干流行的中文 LLMs,结果表明我们的提示对 LLMs 具有显著危害,对 GPT-3.5 的攻击成功率约达 70%。CPAD 公开于 https://github.com/liuchengyuan123/CPAD。

关键词

引用

@article{arxiv.2309.11830,
  title  = {Goal-Oriented Prompt Attack and Safety Evaluation for LLMs},
  author = {Chengyuan Liu and Fubang Zhao and Lizhi Qing and Yangyang Kang and Changlong Sun and Kun Kuang and Fei Wu},
  journal= {arXiv preprint arXiv:2309.11830},
  year   = {2023}
}