JAILJUDGE:基于多智能体增强解释评估框架的全面越狱评判基准
摘要
尽管在增强 LLM 安全性方面取得了进展,但评估 LLM 防御仍是一个挑战,现有方法常缺乏可解释性和对复杂情景的泛化能力,导致评估不完整(例如直接做出判断而无需推理、GPT-4 在复杂案例中的 F1 分数较低、在多语言情景中存在偏见)。为此,我们提出 JAILJUDGE,一个包含多样化风险情景的综合基准,包括合成、对抗、野生和多语言提示,以及高质量的人工标注数据集。JAILJUDGE 数据集包含 35k+ 带推理解释的 instruction-tune 数据,JAILJUDGETEST 包含 4.5k+ 标注的风险情景,以及覆盖十种语言的 6k+ 多语言数据。为在评估中引入显式推理,我们提出 JailJudge MultiAgent 框架,该框架支持 1 到 10 的细粒度得分,并可构建 instruction-tuning ground truth,促进 JAILJUDGE Guard 的开发——一种提供推理并消除 API 成本的 end-to-end judge 模型。此外,我们引入 JailBoost(攻击者不可知的攻击增强器)和 GuardShield( moderation 防御),两者均利用 JAILJUDGE Guard。我们的实验表明,JailJudge 方法(JailJudge MultiAgent、JAILJUDGE Guard)在包括 GPT-4、Llama-Guard 在内的多种模型以及 zero-shot 情景中实现了 state-of-the-art 性能。JailBoost 和 GuardShield 在 zero-shot 设置下的越狱攻击和防御任务中显著提升,JailBoost 提升 29.24%,GuardShield 将防御 ASR 从 40.46% 降至 0.15%。
引用
@article{arxiv.2410.12855,
title = {JAILJUDGE: A Comprehensive Jailbreak Judge Benchmark with Multi-Agent Enhanced Explanation Evaluation Framework},
author = {Fan Liu and Yue Feng and Zhao Xu and Lixin Su and Xinyu Ma and Dawei Yin and Hao Liu},
journal= {arXiv preprint arXiv:2410.12855},
year = {2024}
}