中文

SceneJailEval:面向越狱评估的场景自适应多维框架

计算与语言 2025-11-18 v2

摘要

准确的越狱评估对于大语言模型(LLM)红队测试和越狱研究至关重要。主流方法依赖二元分类(字符串匹配、毒性文本分类器和基于LLM的方法),仅输出“是/否”标签,无法量化危害严重程度。新兴的多维框架(如安全性违规、相对真实性和信息量)在不同场景下使用统一的评估标准,导致场景特定性不匹配(例如,“相对真实性”与“仇恨言论”无关),从而损害了评估的准确性。为解决这些问题,我们提出了SceneJailEval,其主要贡献如下:(1)一个开创性的场景自适应多维越狱评估框架,克服了现有多维方法“一刀切”的关键局限性,并具有强大的可扩展性,可无缝适应定制化或新兴场景。(2)一个新颖的14场景数据集,包含丰富的越狱变体和区域案例,填补了长期以来缺乏高质量、全面的场景自适应评估基准的空白。(3)SceneJailEval提供了最先进的性能,在我们的全场景数据集上F1分数达到0.917(比SOTA高6%),在JBB上达到0.995(比SOTA高3%),突破了现有评估方法在异构场景中的准确性瓶颈,巩固了其优越性。

关键词

引用

@article{arxiv.2508.06194,
  title  = {SceneJailEval: A Scenario-Adaptive Multi-Dimensional Framework for Jailbreak Evaluation},
  author = {Lai Jiang and Yuekang Li and Xiaohan Zhang and Youtao Ding and Li Pan},
  journal= {arXiv preprint arXiv:2508.06194},
  year   = {2025}
}

备注

This paper has been accepted by AAAI 2026 as a poster