NashPG:基于迭代精细化正则化的策略梯度方法用于寻找纳什均衡
机器学习
2026-05-01 v2 计算机科学与博弈论
摘要
在两人零和不完全信息游戏中寻找纳什均衡仍是多智能体强化学习中的核心挑战。最近的多轮正则化方法提供了可行的方向,但现有方法要么需要对游戏树进行完整枚举,要么依赖非策略梯度的内部求解器在实际中表现不佳,留下了一个基于可扩展策略梯度的解决方案。本文提出了一种新的多轮正则化程序,并证明它在两人零和广义形式游戏中保证严格单调减少Bregman散度并最终收敛到纳什均衡。基于这个框架,我们开发了一种实际算法Nash Policy Gradient(NashPG),将正则化直接置于策略优化目标中,并使用标准策略梯度方法实现。实验结果表明,NashPG在经典基准游戏上实现的可利用性与先前模型无关的方法相当或更低,并在规模大的领域如Battleship和无限制德州扑克中取得更高的平均收益。
引用
@article{arxiv.2510.18183,
title = {NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria},
author = {Eason Yu and Tzu Hao Liu and Clément L. Canonne and Yunke Wang and Chang Xu and Nguyen H. Tran and Stefano V. Albrecht},
journal= {arXiv preprint arXiv:2510.18183},
year = {2026}
}