用于多智能体强化学习中均衡选择的 Pareto actor-critic
机器学习
2023-10-17 v3 多智能体系统
摘要
本工作关注无冲突多智能体博弈中的均衡选择问题,我们具体研究在多个已有均衡中选择 Pareto 最优纳什均衡的问题。已有研究表明,许多最先进的多智能体强化学习(MARL)算法由于训练期间各智能体对其他智能体策略的不确定性,容易收敛到被 Pareto 占优的均衡。为解决次优均衡选择问题,我们提出 Pareto Actor-Critic(Pareto-AC),这是一种利用无冲突博弈(合作博弈的超集)简单性质的 actor-critic 算法:无冲突博弈中的 Pareto 最优均衡使所有智能体的回报最大化,因此是各智能体偏好的结果。我们在多种多智能体博弈中评估了 Pareto-AC,表明其相比七种最先进 MARL 算法收敛到更高的回合回报,并能在一系列矩阵博弈中成功收敛到 Pareto 最优均衡。最后,我们提出 PACDCG,即 Pareto-AC 的图神经网络扩展,其在具有大量智能体的博弈中被证明可高效扩展。
引用
@article{arxiv.2209.14344,
title = {Pareto Actor-Critic for Equilibrium Selection in Multi-Agent Reinforcement Learning},
author = {Filippos Christianos and Georgios Papoudakis and Stefano V. Albrecht},
journal= {arXiv preprint arXiv:2209.14344},
year = {2023}
}
备注
Published in Transactions on Machine Learning Research (TMLR); Reviewed on OpenReview: https://openreview.net/forum?id=3AzqYa18ah