中文

越狱税:你的越狱输出有多大用处?

机器学习 2025-04-16 v1 人工智能 密码学与安全

摘要

越狱攻击绕过大语言模型的防护栏以产生有害输出。在本文中,我们探问现有越狱产生的模型输出是否真的有用。例如,当越狱模型以提供制造炸弹的指令时,越狱是否产生了好的指令?由于大多数不安全答案(例如炸弹指令)的效用难以严格评估,我们通过将模型对齐为拒绝回答与良性且易于评估的主题(例如生物学或数学)相关的问题,构建了具有已知真实答案的新越狱评估集。我们在五个效用基准上对八种代表性越狱的评估表明,越狱响应中的模型效用出现了一致的下降,我们将其称为越狱税。例如,虽然我们测试的所有越狱都绕过了被对齐为拒绝回答数学问题的模型的防护栏,但这是以高达 92% 的准确率下降为代价的。总体而言,我们的工作提出了越狱税作为 AI 安全中一个新的重要指标,并引入了用于评估现有和未来越狱的基准。我们在 https://github.com/ethz-spylab/jailbreak-tax 提供了该基准。

关键词

引用

@article{arxiv.2504.10694,
  title  = {The Jailbreak Tax: How Useful are Your Jailbreak Outputs?},
  author = {Kristina Nikolić and Luze Sun and Jie Zhang and Florian Tramèr},
  journal= {arXiv preprint arXiv:2504.10694},
  year   = {2025}
}