基于查询的对抗性提示生成
计算与语言
2024-12-10 v2 人工智能
密码学与安全
机器学习
摘要
最近的研究表明,可以构造对抗性样本,使对齐的语言模型输出有害字符串或执行有害行为。现有的攻击要么在白盒设置下(完全访问模型权重)进行,要么通过可迁移性进行:即在一个模型上制作的对抗性样本通常在其他模型上仍然有效的现象。我们改进了先前的工作,提出了一种基于查询的攻击,利用对远程语言模型的 API 访问来构造对抗性样本,使模型输出有害字符串的概率比仅依靠可迁移性的攻击高得多。我们在 GPT-3.5 和 OpenAI 的安全分类器上验证了我们的攻击;我们可以导致 GPT-3.5 输出当前可迁移性攻击无法实现的有害字符串,并且我们可以以接近 100% 的概率绕过安全分类器。
引用
@article{arxiv.2402.12329,
title = {Query-Based Adversarial Prompt Generation},
author = {Jonathan Hayase and Ema Borevkovic and Nicholas Carlini and Florian Tramèr and Milad Nasr},
journal= {arXiv preprint arXiv:2402.12329},
year = {2024}
}