中文

越狱蒸馏:可再生安全基准测试

计算与语言 2025-05-29 v1 密码学与安全 软件工程

摘要

大型语言模型 (LLM) 正被快速部署到关键应用中,引发了对稳健安全基准测试的迫切需求。我们提出了 Jailbreak Distillation (JBDistill),一种将越狱攻击“蒸馏”为高质量且易于更新的安全基准的新型基准构建框架。JBDistill 利用少量开发模型和现有的越狱攻击算法创建候选提示池,随后采用提示选择算法识别出有效的提示子集作为安全基准。JBDistill 解决了现有安全评估中的挑战:在各模型间使用一致的评估提示确保了公平比较与可复现性。它仅需极少的人力即可重新运行 JBDistill 流水线并生成更新的基准,从而缓解了对饱和与污染的担忧。大量实验表明,我们的基准对未参与基准构建的 13 个多样化评估模型(包括专有模型、专用模型和新一代 LLM)均具有稳健的泛化能力,在有效性上显著优于现有安全基准,同时保持了高可分性与多样性。因此,我们的框架为简化安全评估提供了一种有效、可持续且适应性强的解决方案。

关键词

引用

@article{arxiv.2505.22037,
  title  = {Jailbreak Distillation: Renewable Safety Benchmarking},
  author = {Jingyu Zhang and Ahmed Elgohary and Xiawei Wang and A S M Iftekhar and Ahmed Magooda and Benjamin Van Durme and Daniel Khashabi and Kyle Jackson},
  journal= {arXiv preprint arXiv:2505.22037},
  year   = {2025}
}

备注

Project page: https://aka.ms/jailbreak-distillation