重新思考协作多智能体强化学习中的实现技巧与单调性约束
机器学习
2023-06-09 v9 人工智能
多智能体系统
摘要
许多复杂的多智能体系统,如机器人群体控制与自动驾驶车辆协调,可建模为多智能体强化学习(Multi-Agent Reinforcement Learning, MARL)任务。QMIX 这一广泛流行的 MARL 算法已被用作基准环境(如 Starcraft Multi-Agent Challenge (SMAC)、Difficulty-Enhanced Predator-Prey (DEPP))的基线。QMIX 的近期变体旨在放宽 QMIX 的单调性约束,从而在 SMAC 中提升性能。本文中,我们研究这些变体的代码级优化与单调性约束。(1) 我们发现这些变体的此类改进显著受到各种代码级优化的影响。(2) 实验结果表明,带有归一化优化的 QMIX 在 SMAC 中优于其他工作;(3) 不同于这些工作的普遍认知,单调性约束可提升 SMAC 与 DEPP 中的采样效率。我们还通过理论分析讨论了为何单调性约束在纯协作任务中表现良好。我们在 \url{https://github.com/hijkzzz/pymarl2} 开源了代码。
引用
@article{arxiv.2102.03479,
title = {Rethinking the Implementation Tricks and Monotonicity Constraint in Cooperative Multi-Agent Reinforcement Learning},
author = {Jian Hu and Siyang Jiang and Seth Austin Harding and Haibin Wu and Shih-wei Liao},
journal= {arXiv preprint arXiv:2102.03479},
year = {2023}
}
备注
Accepted by ICLR BlogTrack 2023