中文

JADES:基于分解评分的通用越狱评估框架

密码学与安全 2025-08-29 v1 人工智能

摘要

准确判断越狱尝试是否成功是基本且尚未解决的挑战。现有评估方法依赖误配的代理指标或简单整体判断,常对模型响应产生误解,导致评估不一致且主观,与人类感知不一致。为此,我们引入JADES(Jailbreak Assessment via Decompositional Scoring),一个通用越狱评估框架。其核心机制是自动将输入有害问题分解为加权子问题集合,对每个子答案进行评分,再加权聚合子评分得到最终决定。JADES还集成了可选的事实核查模块,以强化对越狱响应中幻觉的检测。我们在本工作提出的JailbreakQR基准上验证了JADES,该基准包含400对人工标注的越狱提示和响应。在二元设置(成功/失败)下,JADES与人类评估者98.5%的一致性,优于强基线超过9%。对五种流行攻击在四个大语言模型进行重新评估,发现显著的高估(例如LAA的攻击成功率在GPT-3.5-Turbo上下降至69%)。我们的结果表明,JADES能够提供准确、一致且可解释的评估,为衡量未来越狱攻击提供可靠基准。

关键词

引用

@article{arxiv.2508.20848,
  title  = {JADES: A Universal Framework for Jailbreak Assessment via Decompositional Scoring},
  author = {Junjie Chu and Mingjie Li and Ziqing Yang and Ye Leng and Chenhao Lin and Chao Shen and Michael Backes and Yun Shen and Yang Zhang},
  journal= {arXiv preprint arXiv:2508.20848},
  year   = {2025}
}

备注

17 pages, 5 figures. For the code and data supporting this work, see https://trustairlab.github.io/jades.github.io/