中文

通过非合作博弈实现语言模型的安全对齐

人工智能 2026-02-10 v2

摘要

在保持语言模型 (LM) 有用性的同时确保其安全性 remains 一个关键且具有挑战性的 AI 对齐问题。当前方法依赖于顺序对抗训练:生成对抗性提示并微调 LM 以对抗它们。我们引入一种不同范式:将安全对齐表述为攻击者 LM 与防御者 LM 之间的非零和博弈,两者通过在线强化学习联合训练。每个 LM 持续适应对方不断演变的策略,从而实现迭代性改进。我们的方法使用基于成对比较的偏好奖励信号,而非单一得分,提供更稳健的监督并可能减少奖励黑客。我们的 RL 配方,AdvGame,将安全性和实用性的帕累托前沿推动后,产生一个在抗性和有用性同时都更强的防御者 LM。此外,所得攻击者 LM 收敛为一个强大且通用的红队测试代理,可直接部署以探测任意目标模型。

关键词

引用

@article{arxiv.2512.20806,
  title  = {Safety Alignment of LMs via Non-cooperative Games},
  author = {Anselm Paulus and Ilia Kulikov and Brandon Amos and Rémi Munos and Ivan Evtimov and Kamalika Chaudhuri and Arman Zharmagambetov},
  journal= {arXiv preprint arXiv:2512.20806},
  year   = {2026}
}