通过对手感知吸引域进入实现多智能体策略梯度中的均衡选择
机器学习
2026-05-19 v1
摘要
已有研究表明,多智能体策略梯度方法能够在稳定 Nash 均衡附近局部收敛。然而,局部收敛并未决定将到达哪个均衡。我们通过相对于由外部准则(如收益占优)选择的目标均衡集的吸引域进入概率来研究这一问题。对于有限展开 Meta-MAPG,我们证明其更新可分解为普通策略梯度加上自身学习与同伴学习校正,且具有受控的采样噪声与有限展开偏差。我们识别出同伴学习校正是主要的均衡选择机制:在局部对齐条件下,相对于普通策略梯度,进入目标稳定 Nash 集的认证吸引区域的概率增加。由于持续的校正可能移动原博弈的零更新点,在进入吸引域后对校正进行退火可恢复普通策略梯度动力学,并继承局部稳定 Nash 收敛保证。在 Stag Hunt、迭代 Prisoner's Dilemma 以及初步的神经策略协调环境中的实验支持了这一吸引域进入观点,表明在同伴感知更新下进入协作吸引域的比例增加。
引用
@article{arxiv.2605.18078,
title = {Equilibrium Selection in Multi-Agent Policy Gradients via Opponent-Aware Basin Entry},
author = {Yevhen Shcherbinin and Arina Redina and Maxim Kalpin and Vlad Kochetov},
journal= {arXiv preprint arXiv:2605.18078},
year = {2026}
}