Do Anything Now:对大语言模型上真实场景越狱提示的刻画与评估
密码学与安全
2024-05-16 v2 机器学习
摘要
大语言模型(LLMs)的滥用已引起公众和LLM供应商的广泛关注。一类特定的对抗性提示,即越狱提示(jailbreak prompt),已成为绕过安全机制并从LLMs中诱导有害内容的主要攻击向量。在本文中,我们利用新框架JailbreakHub,对2022年12月至2023年12月间的1,405条越狱提示进行了全面分析。我们识别出131个越狱社区,并发现了越狱提示的独特特征及其主要攻击策略,如提示注入(prompt injection)和权限提升(privilege escalation)。我们还观察到越狱提示正日益从在线Web社区转向提示聚合网站,且有28个用户账户在超过100天里持续优化越狱提示。为评估越狱提示造成的潜在危害,我们构建了一个包含13个禁止场景下107,250个样本的问题集。利用该数据集,我们在六个流行LLMs上的实验表明,它们的安全机制无法在所有场景中充分防御越狱提示。特别是,我们识别出五条高度有效的越狱提示,在ChatGPT(GPT-3.5)和GPT-4上达到了0.95的攻击成功率,且最早的一条已在线上持续存在超过240天。我们希望本研究能促进研究界和LLM供应商推动更安全、受监管的LLMs。
引用
@article{arxiv.2308.03825,
title = {"Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models},
author = {Xinyue Shen and Zeyuan Chen and Michael Backes and Yun Shen and Yang Zhang},
journal= {arXiv preprint arXiv:2308.03825},
year = {2024}
}