Vanilla Policy Gradient 被忽视了吗?分析 Hanabi 的深度强化学习
机器学习
2022-03-23 v1 人工智能
多智能体系统
摘要
为了追求增强的多智能体协作,我们在最近发布的 Hanabi 基准中分析了几种 on-policy 深度强化学习算法。我们的研究提出了一个或许有悖直觉的发现,在多智能体合作卡牌游戏的简化环境中,Proximal Policy Optimization (PPO) 在多个随机种子上的表现被 Vanilla Policy Gradient 超越。在对这一行为的分析中,我们研究了 Hanabi 特定的指标,并假设了 PPO 进入停滞期的一个原因。此外,我们提供了完美博弈(71 回合)和任意博弈(89 回合)最大长度的证明。我们的代码可在以下网址找到:https://github.com/bramgrooten/DeepRL-for-Hanabi
引用
@article{arxiv.2203.11656,
title = {Is Vanilla Policy Gradient Overlooked? Analyzing Deep Reinforcement Learning for Hanabi},
author = {Bram Grooten and Jelle Wemmenhove and Maurice Poot and Jim Portegies},
journal= {arXiv preprint arXiv:2203.11656},
year = {2022}
}
备注
Accepted at ALA 2022 (Adaptive and Learning Agents Workshop at AAMAS 2022)