中文

TriPlay-RL:用于 LLM 安全对齐的三角色自博弈强化学习

机器学习 2026-02-02 v2 人工智能

摘要

近年来,与大型语言模型相关的安全风险日益突出,凸显了缓解有毒有害内容生成的迫切需求。LLM 安全对齐的主流范式通常采用包含三个角色的协作框架:用于生成对抗性提示词的攻击者、用于安全防御的防御者,以及用于响应评估的评估者。在本文中,我们提出了一种名为 TriPlay-RL 的闭环强化学习框架,能够在近乎零人工标注的情况下实现三个角色间的迭代协同改进。实验结果表明,攻击者在保持高输出多样性的同时,对抗有效性提升了 20%-50%;防御者在不降低通用推理能力的前提下,安全性能提升了 10%-30%;评估者则通过迭代不断优化其细粒度判断能力,能够准确区分不安全响应、简单拒绝和有用指导。总体而言,我们的框架为 LLM 安全对齐建立了一种高效且可扩展的范式,实现了统一学习闭环内的持续协同进化。

关键词

引用

@article{arxiv.2601.18292,
  title  = {TriPlay-RL: Tri-Role Self-Play Reinforcement Learning for LLM Safety Alignment},
  author = {Zhewen Tan and Wenhan Yu and Jianfeng Si and Tongxin Liu and Kaiqi Guan and Huiyan Jin and Jiawen Tao and Xiaokun Yuan and Duohe Ma and Xiangzheng Zhang and Tong Yang and Lin Sun},
  journal= {arXiv preprint arXiv:2601.18292},
  year   = {2026}
}