中文

一分钟内完成针对语言模型的快速对抗攻击

密码学与安全 2024-02-27 v1 人工智能 计算与语言

摘要

在本文中,我们介绍了一类新型的基于束搜索的快速对抗攻击(BEAST),适用于语言模型(LMs)。BEAST 采用可解释的参数,使攻击者能够平衡攻击速度、成功率以及对抗提示的可读性。BEAST 的计算效率使我们能够调查其在语言模型越狱、诱导幻觉和隐私攻击方面的应用。我们的无梯度定向攻击可在一分钟内以高成功率攻破对齐的语言模型。例如,在使用单个 Nvidia RTX A6000 48GB GPU 的情况下,BEAST 可在一分钟内以 89% 的成功率攻破 Vicuna-7B-v1.5,而基于梯度的基线方法需要超过一小时才能达到 70% 的成功率。此外,我们发现了一个独特的结果,即我们的非定向攻击会诱导语言模型聊天机器人产生幻觉。通过人工评估,我们发现与未受攻击的语言模型输出相比,我们的非定向攻击导致 Vicuna-7B-v1.5 产生的错误输出增加了约 15%。我们还了解到,BEAST 有 22% 的概率导致 Vicuna 生成与原始提示无关的输出。进一步地,我们利用 BEAST 在几秒钟内生成对抗提示,从而提升现有针对语言模型的成员推断攻击的性能。我们相信,我们的快速攻击 BEAST 有潜力加速语言模型安全与隐私方面的研究。我们的代码库已在 https://github.com/vinusankars/BEAST 公开。

关键词

引用

@article{arxiv.2402.15570,
  title  = {Fast Adversarial Attacks on Language Models In One GPU Minute},
  author = {Vinu Sankar Sadasivan and Shoumik Saha and Gaurang Sriramanan and Priyatham Kattakinda and Atoosa Chegini and Soheil Feizi},
  journal= {arXiv preprint arXiv:2402.15570},
  year   = {2024}
}