具有伙伴选择的社会困境中策略梯度的动力学
多智能体系统
2026-05-19 v1
摘要
在社会困境中,自利的学习智能体面临着在社会合作收益与背叛即时奖励之间的选择。关于伙伴选择等匹配机制对合作涌现的益处存在大量证据,但这主要通过基于智能体的仿真获得。在本文中,我们为该问题提供了解析解,研究了具有伙伴选择的多智能体环境中的策略梯度动力学。我们展示了伙伴选择如何改变对手分布进而改变奖励景观,并证明这促进了文献中已知简单规则下的合作。特别地,我们发现种群方差是合作涌现的必要条件。利用二维 Wiener 过程,我们将该动力学扩展以捕捉伙伴选择的随机效应及由此产生的对手分布。我们推导了种群成为促进合作的充分条件,并证明了平稳分布的存在性。仿真证实了该随机模型准确捕捉了策略梯度动力学,并阐明了学习率如何影响合作的涌现。
引用
@article{arxiv.2605.18185,
title = {The Dynamics of Policy Gradient in Social Dilemmas with Partner Selection},
author = {Benedict Russell and Chin-wing Leung and Paolo Turrini},
journal= {arXiv preprint arXiv:2605.18185},
year = {2026}
}