MAPPO-LCR:基于局部合作奖励的多智能体 Proximal Policy Optimization 用以空间公共物游戏
多智能体系统
2025-12-23 v2 计算机科学与博弈论
摘要
空间公共物游戏建模了个体收益取决于人口水平策略配置的集体困境。大多数现有研究依赖演化更新规则或基于价值的强化学习方法。这些方法难以表示大规模相互作用人群中的 payoff 耦合和非平稳性。本工作首次将多智能体 Proximal Policy Optimization(MAPPO)引入空间公共物游戏。在这些游戏中,个体收益通过重叠的群体互动而内在地耦合。Proximal Policy Optimization(PPO)将智能体视为独立学习者,在价值估计时忽略这种耦合。MAPPO 通过集中式 critic 来评估联合策略配置,以克服这一限制。为研究该框架下社区层面合作信号,我们提出了带局部合作奖励的 MAPPO,称为 MAPPO-LCR。局部合作奖励在不改变原始游戏结构的前提下,将 policy 更新与周围合作密度对齐。MAPPO-LCR 保持了分布式执行,同时在训练期间实现人口水平价值估计。广泛的仿真实验表明,该方法能够稳定地促进合作出现并实现可靠收敛。统计分析进一步确认了 MAPPO 在空间公共物游戏中相对于 PPO 的学习优势。
引用
@article{arxiv.2512.17187,
title = {MAPPO-LCR: Multi-Agent Proximal Policy Optimization with Local Cooperation Reward in Spatial Public Goods Games},
author = {Zhaoqilin Yang and Axin Xiang and Kedi Yang and Tianjun Liu and Youliang Tian},
journal= {arXiv preprint arXiv:2512.17187},
year = {2025}
}