中文

中文跳棋中的高效学习:比较多智能体强化学习中的参数共享

人工智能 2024-05-30 v1

摘要

我们表明,在中文跳棋这种竞争性完美信息同构游戏中,采用全参数共享的多智能体强化学习(MARL)优于独立和部分共享架构。在实验中,我们开发了新的MARL环境:可变规模的六人中文跳棋。该自定义环境开发于PettingZoo,支持游戏的全部传统规则,包括链式跳跃。这在事实上是首个忠实于真实游戏规则的中文跳棋实现。由于其庞大的分支因子和潜在的无限时间范围,中文跳棋难以学习。我们借鉴了其他RL领域中复杂动作空间中的分支动作(子动作)的概念,其中子动作可能不会立即结束玩家的回合。这大大降低了动作空间的维度。我们的观察空间受AlphaGo启发,使用许多二进制游戏板堆叠成的3D数组来编码信息。PettingZoo环境、训练和评估逻辑以及分析脚本均可在\href{https://github.com/noahadhikari/pettingzoo-chinese-checkers}{Github}上找到。

关键词

引用

@article{arxiv.2405.18733,
  title  = {Efficient Learning in Chinese Checkers: Comparing Parameter Sharing in Multi-Agent Reinforcement Learning},
  author = {Noah Adhikari and Allen Gu},
  journal= {arXiv preprint arXiv:2405.18733},
  year   = {2024}
}