中文

利用 Purple 问题测试越狱防御的极限

密码学与安全 2024-06-25 v2 计算与语言 机器学习

摘要

针对语言模型的“越狱”攻击的兴起引发了大量旨在防止不良响应的防御方法。我们批判性地审查了防御流程的两个阶段: 定义什么构成不安全输出,以及 通过输入处理或微调等方法执行该定义。为了测试现有执行机制的有效性,我们考虑了一个简单且定义明确的不安全输出定义——即包含单词“purple”的输出。令人惊讶的是,现有的微调和输入防御在这个简单问题上就遭遇了失败,这让人怀疑执行算法对于更复杂定义是否能够保持稳健。我们发现,真实的安全基准同样测试的是针对固定定义的执行。我们希望未来的研究能够带来有效/快速的执行机制,以及用于执行和评估的高质量定义。

关键词

引用

@article{arxiv.2403.14725,
  title  = {Testing the Limits of Jailbreaking Defenses with the Purple Problem},
  author = {Taeyoun Kim and Suhas Kotha and Aditi Raghunathan},
  journal= {arXiv preprint arXiv:2403.14725},
  year   = {2024}
}