对称双队马尔可夫博弈中基于值的CTDE方法:从合作到队伍竞争
机器学习
2022-12-01 v2 计算机科学与博弈论
多智能体系统
摘要
本文中,我们确定了训练一支智能体队伍以对抗对手队伍多种可能策略的最佳学习场景。我们在混合合作-竞争环境中评估基于值的合作方法。我们将自身限定于对称、部分可观测的双队马尔可夫博弈情形。我们基于集中训练与分散执行(CTDE)范式选取了三种训练方法:QMIX、MAVEN与QVMix。对每种方法,我们考虑了三种按训练期间所遇队伍策略多样性区分的学习场景。为实验,我们修改了星际争霸多智能体挑战(StarCraft Multi-Agent Challenge)环境,以创建两支队伍可同时学习与竞争的对抗环境。我们的结果表明,当以多种策略面对来评判成绩时,对抗多种演化策略训练可取得最佳结果。
引用
@article{arxiv.2211.11886,
title = {Value-based CTDE Methods in Symmetric Two-team Markov Game: from Cooperation to Team Competition},
author = {Pascal Leroy and Jonathan Pisane and Damien Ernst},
journal= {arXiv preprint arXiv:2211.11886},
year = {2022}
}