基于组相对策略优化与全局合作约束的空间公共 goods 游戏合作提升:GRPO-GCC
多智能体系统
2025-10-13 v1 计算机科学与博弈论
摘要
受自我调节合作制度原则的启发,我们提出了组相对策略优化与全局合作约束(GRPO-GCC)框架。本工作首次将GRPO引入空间公共 goods 游戏,建立了结构化人口的深度强化学习新基准。GRPO-GCC将组相对策略优化与全局合作约束相结合,通过强化中间合作水平的激励同时削弱极端合作水平的激励,使局部决策与可持续的集体结果保持一致,防止陷入全体背离或无条件合作的灾难性循环。该框架超越现有方法,融合了组归一化优势估计、参考锚定KL惩罚以及动态调整的全局激励项,实现了合作启动加速、策略适应稳定化以及长期可持续性。GRPO-GCC表明,简单却全局的信号如何重塑合作激励以实现韧性合作,为社会技术系统中的多主体强化学习提供新范式。
引用
@article{arxiv.2510.08607,
title = {GRPO-GCC: Enhancing Cooperation in Spatial Public Goods Games via Group Relative Policy Optimization with Global Cooperation Constraint},
author = {Zhaoqilin Yang and Chanchan Li and Tianqi Liu and Hongxin Zhao and Youliang Tian},
journal= {arXiv preprint arXiv:2510.08607},
year = {2025}
}