中文

SPIRAL: 基于多智能体多回合强化学习的零和博弈自我对弈激励推理

人工智能 2026-03-03 v3 计算与语言 机器学习

摘要

近期强化学习进展表明,语言模型可通过针对可验证奖励的任务进行训练,发展出 sophisticated 的推理能力,但这些方法依赖人类精选的问题-答案对和领域特定的奖励工程。我们引入SPIRAL——一种自我对弈框架,其中模型通过对抗不断提升的自身版本进行多回合零和博弈训练,自动生成更强对手,无需人工监督。为实现规模化自我对弈训练,我们实现了LLM的全在线、多回合、多智能体强化学习系统,并提出角色条件优势估计(RAE)以稳定多智能体训练。SPIRAL产生的推理能力可广泛迁移,在4个不同模型(涵盖Qwen和Llama模型系列)上的8个推理基准测试中性能提升最高可达10%,超越2.5万组专家博弈轨迹的监督微调。多游戏训练(TicTacToe、Kuhn Poker、Simple Negotiation) yield最佳结果,无论是基础模型还是指令调优模型均观察到改进。对链式思维轨迹的分析揭示,博弈发展出distinct认知模式,这些模式可迁移以改善推理绩效,不同博弈发展出互补的优势。即便是已使用RLVR训练推理任务的模型(如DeepSeek-R1-Distill-Qwen-7B)仍能从我们的ethods中受益。这些结果表明,零和博弈自然发展出可迁移的推理能力,跨越不同模型架构和训练阶段,凸显了自主推理发展的有前景方向。我们的代码可在https://github.com/spiral-rl/spiral中获取。

关键词

引用

@article{arxiv.2506.24119,
  title  = {SPIRAL: Self-Play on Zero-Sum Games Incentivizes Reasoning via Multi-Agent Multi-Turn Reinforcement Learning},
  author = {Bo Liu and Leon Guertler and Simon Yu and Zichen Liu and Penghui Qi and Daniel Balcells and Mickel Liu and Cheston Tan and Weiyan Shi and Min Lin and Wee Sun Lee and Natasha Jaques},
  journal= {arXiv preprint arXiv:2506.24119},
  year   = {2026}
}

备注

Accepted at ICLR 2026. Code: https://github.com/spiral-rl/spiral