中文

TROJail:基于过程奖励的多轮大语言模型越狱轨迹级优化

人工智能 2026-04-22 v3 机器学习

摘要

大语言模型已广泛采用,但仍对多轮越狱攻击脆弱,这威胁了其安全部署。这引发了训练自动化多轮攻击者以探测模型安全漏洞的任务。然而,现有方法通常依赖轮级优化,对学习长期攻击策略不足。为弥合这一差距,我们将此任务形式化为多轮强化学习问题,直接优化最终轮响应的有害性作为结果奖励。为解决结果奖励的稀疏监督,我们引入TROJail,通过两种过程奖励评估中间提示的效用并将其整合到优势估计中。这些奖励(1)惩罚过于有害的提示以触发模型的拒绝机制,(2)鼓励引导响应的语义相关性以针对目标有害内容。实验结果显示,在多个模型和基准测试上实现了更高的攻击成功率,凸显了我们方法的有效性。代码已公开于 https://github.com/xxiqiao/TROJail. 警告:本文包含有害内容示例。

关键词

引用

@article{arxiv.2512.07761,
  title  = {TROJail: Trajectory-Level Optimization for Multi-Turn Large Language Model Jailbreaks with Process Rewards},
  author = {Xiqiao Xiong and Ouxiang Li and Zhuo Liu and Moxin Li and Wentao Shi and Fengbin Zhu and Qifan Wang and Fuli Feng},
  journal= {arXiv preprint arXiv:2512.07761},
  year   = {2026}
}

备注

Accepted to ACL 2026 Main Conference