中文

利用在线自博弈强化学习追逐移动目标以构建更安全的语言模型

机器学习 2025-10-07 v3 计算与语言 多智能体系统

摘要

传统的语言模型安全对齐依赖于一种被动的、脱节的流程:攻击者利用静态模型,随后进行防御性微调以修补暴露的漏洞。这种顺序方法造成了一种错配——攻击者过度拟合于过时的防御,而防御者则永远落后于新兴威胁。为解决此问题,我们提出了Self-RedTeam,一种在线自博弈强化学习算法,其中攻击者和防御者智能体通过持续交互共同进化。我们将安全对齐建模为一个两人零和博弈,其中单个模型在攻击者和防御者角色之间交替——生成对抗性提示并防御它们——同时由一个奖励语言模型裁定结果。这实现了动态协同适应。基于零和博弈的博弈论框架,我们建立了一个理论上的安全保证,这启发了我们方法的设计:如果自博弈收敛到纳什均衡,防御者将对任何对抗性输入可靠地产生安全响应。在实证方面,与针对静态防御者训练的攻击者相比,Self-RedTeam发现了更多样化的攻击(SBERT分数提高21.8%),并且在安全基准测试上实现了比针对静态攻击者训练的防御者更高的鲁棒性(例如,在WildJailBreak上提高65.5%)。我们进一步提出了隐藏思维链,允许智能体私下规划,这增强了对抗多样性并减少了过度拒绝。我们的结果推动了语言模型安全训练从被动修补向主动协同进化的转变,从而通过多智能体强化学习实现语言模型可扩展、自主且鲁棒的自我改进。

关键词

引用

@article{arxiv.2506.07468,
  title  = {Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models},
  author = {Mickel Liu and Liwei Jiang and Yancheng Liang and Simon Shaolei Du and Yejin Choi and Tim Althoff and Natasha Jaques},
  journal= {arXiv preprint arXiv:2506.07468},
  year   = {2025}
}