Jailbreak-R1:通过强化学习探索 LLM 的越狱能力
人工智能
2025-06-03 v1
摘要
随着大型语言模型能力和影响力的增长,确保其安全性并防止有害输出变得至关重要。自动化红队测试作为一种无需人工劳动即可检测 LLM 安全漏洞的工具。然而,现有大多数方法难以平衡红队生成的攻击提示的有效性和多样性。为了应对这一挑战,我们提出了 \ourapproach,一种新颖的自动化红队测试训练框架,利用强化学习来探索并生成更有效的攻击提示,同时平衡其多样性。具体而言,它包含三个训练阶段:(1) 冷启动:红队模型在通过模仿学习获得的越狱数据集上进行监督微调。(2) 预热探索:使用多样性和一致性作为奖励信号,训练模型进行越狱指令遵循和探索。(3) 增强越狱:引入渐进式越狱奖励,逐步增强红队模型的越狱性能。在多种 LLM 上的广泛实验表明,与现有方法相比,\ourapproach 有效地平衡了越狱提示的多样性和有效性。我们的工作显著提高了红队探索的效率,并为自动化红队测试提供了新的视角。
引用
@article{arxiv.2506.00782,
title = {Jailbreak-R1: Exploring the Jailbreak Capabilities of LLMs via Reinforcement Learning},
author = {Weiyang Guo and Zesheng Shi and Zhuo Li and Yequan Wang and Xuebo Liu and Wenya Wang and Fangming Liu and Min Zhang and Jing Li},
journal= {arXiv preprint arXiv:2506.00782},
year = {2025}
}
备注
21 pages, 8 figures