通过密码字符越狱绕过审核护栏的大型语言模型
密码学与安全
2024-06-03 v1 计算与语言
计算机视觉与模式识别
机器学习
摘要
大型语言模型(LLM)通常是无害的,但仍然容易受到精心设计的提示(称为“越狱”)的攻击,这些提示可以绕过保护措施并诱导有害行为。LLM的最新进展包含了能够过滤输出的审核护栏,这些护栏会对某些恶意问题触发处理错误。现有的红队基准测试通常忽略包含触发审核护栏的问题,使得评估越狱效果变得困难。为了解决这个问题,我们引入了JAMBench,一个旨在触发和评估审核护栏的有害行为基准测试。JAMBench包含160条手工制作的指令,涵盖四个主要风险类别,并具有多个严重级别。此外,我们提出了一种越狱方法JAM(Jailbreak Against Moderation),旨在攻击审核护栏:使用越狱前缀绕过输入级过滤器,并使用一个与护栏模型功能等价的微调影子模型生成密码字符以绕过输出级过滤器。我们在四个LLM上的大量实验表明,与基线相比,JAM实现了更高的越狱成功率(约 19.88)和更低的过滤率(约 1/6)。
引用
@article{arxiv.2405.20413,
title = {Jailbreaking Large Language Models Against Moderation Guardrails via Cipher Characters},
author = {Haibo Jin and Andy Zhou and Joe D. Menke and Haohan Wang},
journal= {arXiv preprint arXiv:2405.20413},
year = {2024}
}
备注
20 pages