解耦动态下的部分可观测马尔可夫博弈中纳什均衡的独立学习
计算机科学与博弈论
2026-05-08 v1 机器学习
多智能体系统
摘要
我们研究了在部分可观测马尔可夫博弈(POMGs)中学习纳什均衡,这是一种多智能体强化学习框架,其中智能体无法完全观察底层状态。该设置下的先行工作依赖于集中化或信息共享,导致样本和计算复杂度随玩家数量呈指数级增长。我们聚焦于具有独立状态转移的 POMG 子类,其中智能体通过其奖励保持耦合,假设底层完全观察的马尔可夫博弈是马尔可夫潜在博弈。对于这一类,我们提出一种独立学习算法,使得智能体仅观察自身的动作和观察、无需通信,即可联合收敛至近似纳什均衡。由于部分可观测性,最优策略可能一般依赖完整的动作-观察历史。我们在滤波器稳定性假设下,表明基于有限历史窗口的策略提供了足够的逼近保证。这使我们能够用一个近似马尔可夫博弈来近似 POMG 后,导致该 POMG 中独立纳什均衡学习的样本复杂度和计算复杂度为准多项式。
关键词
引用
@article{arxiv.2605.06377,
title = {Independent Learning of Nash Equilibria in Partially Observable Markov Potential Games with Decoupled Dynamics},
author = {Philip Jordan and Maryam Kamgarpour},
journal= {arXiv preprint arXiv:2605.06377},
year = {2026}
}