Jailbreak-Zero:大型语言模型红队测试的Pareto最优之路
计算与语言
2026-01-08 v1 密码学与安全
机器学习
摘要
本文介绍了 Jailbreak-Zero,这是一种新的红队测试方法,旨在将大型语言模型(LLM)安全评估的范式从受限的基于示例的方法,转向更为广泛且有效的基于策略的框架。通过利用攻击 LLM 生成大量多样化的对抗性提示,然后利用偏好数据集对该攻击模型进行微调,Jailbreak-Zero 在政策覆盖性、攻击策略多样性和提示对真实用户输入的忠实度三个关键目标上实现了帕累托最优。实证证据表明,该方法的优越性,在针对开源模型和专有模型(如 GPT-40 和 Claude 3.5)时,攻击成功率显著高于现有最先进技术。关键在于,Jailbreak-Zero 能够生成人类可读且有效的对抗性提示,几乎不需要人工干预,从而为识别和缓解 LLM 的安全漏洞提供了更可扩展、更全面的解决方案。
引用
@article{arxiv.2601.03265,
title = {Jailbreak-Zero: A Path to Pareto Optimal Red Teaming for Large Language Models},
author = {Kai Hu and Abhinav Aggarwal and Mehran Khodabandeh and David Zhang and Eric Hsin and Li Chen and Ankit Jain and Matt Fredrikson and Akash Bharadwaj},
journal= {arXiv preprint arXiv:2601.03265},
year = {2026}
}
备注
Socially Responsible and Trustworthy Foundation Models at NeurIPS 2025