LMFPPO-UBP:用于空间公共 goods 游戏的局部均值场近端政策优化 with 不平衡惩罚
计算机科学与博弈论
2026-02-24 v1
摘要
空间公共 goods 游戏以高维状态空间和局部外部性为特征,这对实现稳定和广泛的合作构成重大挑战。传统方法往往难以有效捕捉社区水平的战略互动并动态地将 individual incentives 与 collective welfare 对齐。为解决此问题,本文引入一种名为 Local Mean-Field Proximal Policy Optimization with Unbalanced Punishment(LMFPPO-UBP)的新型智能决策框架。将常规均值场概念重新表述为嵌入深层强化学习策略梯度空间的社会统计传感器,允许代理人基于中尺度社区动力学调整其策略。此外,集成了一种不平衡惩罚机制,用于按合作代理人当地密度对 defectors 进行惩罚,从而在不对合作代理人施加直接成本的情况下重塑 payoff 结构。实验结果表明,LMFPPO-UBP 在低增强因子下仍能促进快速稳定的全球合作,持续优于 Q 学习和费米更新规则等基线方法。统计分析进一步验证了该框架在降低合作阈值和实现更好协调结果方面的有效性。
引用
@article{arxiv.2602.18696,
title = {LMFPPO-UBP: Local Mean Field Proximal Policy Optimization with Unbalanced Punishment for Spatial Public Goods Games},
author = {Jinshuo Yang and Zhaoqilin Yang and Wenjie Zhou and Xin Wang and Youliang Tian},
journal= {arXiv preprint arXiv:2602.18696},
year = {2026}
}