对 LLM 中 RL 越狱攻击的系统性研究
机器学习
2026-05-11 v1 人工智能
摘要
生成模型从下一词元预测器到复杂系统自主引擎的演进,需要严格的安全性强化。对抗性越狱,即通过策略性操纵模型以诱使其产生有害输出,仍然是安全部署的主要威胁。虽然强化学习(RL)通过序列优化将越狱构建为多步攻击,但对该框架为何成功的机制性理解仍不完整。为了填补这一空白,我们首次对 RL 越狱进行了系统性分解。我们将该框架解构为问题形式化(奖励函数、动作空间、回合长度)和算法措施(RL 算法、训练数据、奖励塑形),以识别对抗成功的结构性决定因素。我们的结果表明,RL 越狱攻击成功攻破了所有目标模型和安全防护。通过这种首创的分析,我们证明了环境形式化,特别是密集奖励和延长的回合长度,是越狱成功的主要驱动力。这项工作提供了一种提高 RL 越狱攻击效率的工具,并最终旨在强化生成模型对基于 RL 攻击的抵抗力。
引用
@article{arxiv.2605.07032,
title = {A Systematic Investigation of The RL-Jailbreaker in LLMs},
author = {Montaser Mohammedalamen and Kevin Roice and Reginald McLean and Alyssa Lefaivre Škopac},
journal= {arXiv preprint arXiv:2605.07032},
year = {2026}
}
备注
Warning: To demonstrate vulnerabilities, this paper contains unfiltered and potentially offensive jailbreaking examples. Reader discretion advised