中文

具有信息共享的部分可观测多智能体强化学习

机器学习 2026-03-16 v5 计算机科学与博弈论 多智能体系统

摘要

我们在部分可观测随机博弈(POSG)的一般框架下研究可证明的多智能体强化学习(RL)。为规避已知的困难性结果以及计算上难处理的预言机的使用,我们主张利用智能体之间潜在的信息共享——这是经验多智能体 RL 中的常见做法,也是具有通信的多智能体控制系统的标准模型。我们首先建立了若干计算复杂性结果,以证明在可处理地求解 POSG 时,信息共享的必要性,以及使得具有部分观测的单智能体 RL 能在拟多项式时间和样本量下完成的观测性假设。受真值模型中规划低效的启发,我们进而提出进一步近似共享的公共信息以构造 POSG 的近似模型,在上述假设下,可在该模型中以拟多项式时间找到(原 POSG 的)近似均衡。此外,我们开发了时间和样本复杂度均为拟多项式的部分可观测多智能体 RL 算法。最后,除均衡学习外,我们将算法框架扩展到在合作型 POSG(即分散式部分可观测马尔可夫决策过程)中寻找团队最优解这一更具挑战性的目标。我们在模型的若干结构假设下建立了具体的计算与样本复杂度。我们希望本研究能开启利用乃至设计不同信息结构(控制理论中一个被充分研究的观念)的可能性,以发展兼具样本与计算效率的部分可观测多智能体 RL。

关键词

引用

@article{arxiv.2308.08705,
  title  = {Partially Observable Multi-Agent Reinforcement Learning with Information Sharing},
  author = {Xiangyu Liu and Kaiqing Zhang},
  journal= {arXiv preprint arXiv:2308.08705},
  year   = {2026}
}

备注

Final journal version of the ICML 2023 conference paper, accepted to SIAM Journal on Control and Optimization (SICON)