在博弈论强化学习中结合树搜索、生成模型与纳什议价概念
人工智能
2026-04-07 v4 计算机科学与博弈论
机器学习
多智能体系统
摘要
对手建模方法通常包括两个关键步骤:构建对手策略上的信念分布,以及通过采取最优响应来利用该对手模型。然而,现有方法通常需要领域特定的启发式方法来建立此类模型,且近似最优响应的算法在大型不完美信息领域中难以扩展。本文引入一种可扩展且通用的多智能体训练机制,利用深度博弈论强化学习进行对手建模。我们首先提出生成式最优响应(GenBR),一种基于蒙特卡洛树搜索(MCTS)与学习到的深度生成模型的最优响应算法,该模型在规划过程中采样世界状态。这一新方法可扩展到大型不完美信息领域,并可作为即插即用的模块用于多种多智能体算法。我们在策略空间响应预言机(PSRO)框架下使用这一新方法,通过迭代博弈论推理与基于种群的训练自动生成离线对手模型。我们提出利用基于议价理论的解概念来构建对手混合,发现其能识别接近帕累托前沿的策略剖面。随后GenBR持续更新在线对手模型并在博弈中针对其作出反应。我们开展了行为研究,让人类参与者在Deal-or-No-Deal(一类双边议价博弈)中与我们的智能体谈判。带有生成式建模的搜索在训练时与测试时均发现了更强的策略,实现了在线贝叶斯协同玩家预测,并能产生在与人谈判时达到与人类相互交易相当的社会福利与纳什议价分数的智能体。
引用
@article{arxiv.2302.00797,
title = {Combining Tree-Search, Generative Models, and Nash Bargaining Concepts in Game-Theoretic Reinforcement Learning},
author = {Zun Li and Marc Lanctot and Kevin R. McKee and Luke Marris and Ian Gemp and Daniel Hennes and Paul Muller and Kate Larson and Yoram Bachrach and Michael P. Wellman},
journal= {arXiv preprint arXiv:2302.00797},
year = {2026}
}
备注
Accepted by IJCAI'25 main track