中文

聚合马尔可夫博弈中粗相关均衡的分布式多智能体强化学习

计算机科学与博弈论 2026-03-31 v1 系统与控制 系统与控制

摘要

本文研究了聚合马尔可夫博弈(AMGs)中粗相关均衡(CCE)的分布式学习问题,其中每个智能体的瞬时奖励仅取决于其自身动作和一个聚合量。现有的通用马尔可夫博弈 CCE 学习算法并非为利用聚合结构而设计,而 AMGs 中分布式 CCE 学习的研究仍然有限。我们提出了一种自适应阶段式 V-learning 算法,在完全分布式信息设置下利用聚合结构。基于双时间尺度思想,该算法将学习划分为阶段,并根据聚合信号的可变性调整阶段长度,同时在每个阶段内使用无遗憾更新。我们证明该算法在 O(SAmaxT5/ϵ2)O(S A_{\max} T^5 / \epsilon^2) 轮次内达到 ϵ\epsilon-近似 CCE,避免了多智能体学习中常见的多智能体诅咒。数值结果验证了理论发现,而分布式、无模型设计使其易于扩展至大规模多智能体场景。

关键词

引用

@article{arxiv.2603.27575,
  title  = {Decentralized MARL for Coarse Correlated Equilibrium in Aggregative Markov Games},
  author = {Siying Huang and Yifen Mu and Ge Chen},
  journal= {arXiv preprint arXiv:2603.27575},
  year   = {2026}
}