Alpha-Mini:基于深度强化学习的迷你国际象棋智能体
机器学习
2021-12-28 v1 人工智能
摘要
我们训练了一个在 Gardner 迷你国际象棋(一种在 5x5 棋盘上进行的国际象棋缩小变体)中竞争的智能体。我们论证并应用了 SOTA 演员-评论家方法——带广义优势估计的近端策略优化(Proximal Policy Optimization with Generalized Advantage Estimation)。我们最初的任务围绕训练该智能体对抗随机智能体展开。一旦获得合理表现,我们便采用 AlphaGo 所采用的迭代策略改进版本,使智能体与日益增强的自身版本对弈,并评估由此带来的性能提升。最终智能体对随机智能体取得了近乎(.97)完美的胜率。我们还探索了利用通过自对弈收集的位置集合对网络进行预训练的效果。
引用
@article{arxiv.2112.13666,
title = {Alpha-Mini: Minichess Agent with Deep Reinforcement Learning},
author = {Michael Sun and Robert Tan},
journal= {arXiv preprint arXiv:2112.13666},
year = {2021}
}