中文跳棋中的高效学习:比较多智能体强化学习中的参数共享
人工智能
2024-05-30 v1
摘要
我们表明,在中文跳棋这种竞争性完美信息同构游戏中,采用全参数共享的多智能体强化学习(MARL)优于独立和部分共享架构。在实验中,我们开发了新的MARL环境:可变规模的六人中文跳棋。该自定义环境开发于PettingZoo,支持游戏的全部传统规则,包括链式跳跃。这在事实上是首个忠实于真实游戏规则的中文跳棋实现。由于其庞大的分支因子和潜在的无限时间范围,中文跳棋难以学习。我们借鉴了其他RL领域中复杂动作空间中的分支动作(子动作)的概念,其中子动作可能不会立即结束玩家的回合。这大大降低了动作空间的维度。我们的观察空间受AlphaGo启发,使用许多二进制游戏板堆叠成的3D数组来编码信息。PettingZoo环境、训练和评估逻辑以及分析脚本均可在\href{https://github.com/noahadhikari/pettingzoo-chinese-checkers}{Github}上找到。
关键词
引用
@article{arxiv.2405.18733,
title = {Efficient Learning in Chinese Checkers: Comparing Parameter Sharing in Multi-Agent Reinforcement Learning},
author = {Noah Adhikari and Allen Gu},
journal= {arXiv preprint arXiv:2405.18733},
year = {2024}
}