中文

Strat-Reasoner:强化 LLM 在多智能体博弈中的策略推理

人工智能 2026-05-26 v2

摘要

尽管大型语言模型(LLM)在某些推理任务中表现出色,但在多智能体博弈中,由于最终结果取决于所有智能体的联合策略,它们仍面临困难。在多智能体博弈中,其他智能体的非平稳性给推理过程评估和多步推理的信用分配带来了重大挑战。现有的单智能体强化学习(RL)方法及其多智能体扩展未能解决这些挑战,因为它们未将其他智能体纳入推理过程。在本工作中,我们提出了 Strat-Reasoner,一种新颖的基于 RL 的框架,旨在提升 LLM 在多智能体博弈中的策略推理能力。我们引入了一种新颖的递归推理范式,其中一个智能体的推理也整合了其他智能体的推理过程。为了为中间推理序列提供有效的奖励信号,我们采用集中式思维链(CoT)比较模块来评估推理质量。最后,我们计算精确的混合优势,并开发了一种群体相对 RL 方法来优化 LLM 策略。实验结果表明,Strat-Reasoner 显著提升了底层 LLM 的策略能力,在各种多智能体博弈中实现了 22.1% 的平均性能提升。代码已公开于 https://github.com/ydhe1012/Strat-Reasoner。

关键词

引用

@article{arxiv.2605.04906,
  title  = {Strat-Reasoner: Reinforcing Strategic Reasoning of LLMs in Multi-Agent Games},
  author = {Yidong He and Yutao Lai and Pengxu Yang and Jiarui Gan and Jiexin Wang and Yi Cai and Mengchen Zhao},
  journal= {arXiv preprint arXiv:2605.04906},
  year   = {2026}
}