中文

面向通用游戏玩的蒙特卡洛Q-learning

人工智能 2018-05-22 v2

摘要

在AlphaGo近期取得突破性结果之后,我们看到了博弈中强化学习的强烈兴趣。通用游戏玩(GGP)为强化学习提供了良好的测试平台。在GGP中,给出游戏规则规范。GGP问题可通过强化学习求解。Q-learning是典型强化学习方法之一,且已被Banerjee & Stone (IJCAI 2007)用于GGP。本文中我们在GGP中为三种小棋盘游戏(井字棋、四子棋、六角棋)实现Q-learning,以便与Banerjee等人比较。如预期,Q-learning收敛,尽管远慢于MCTS。借自MCTS的思想,我们用蒙特卡洛搜索增强Q-learning,得到QM-learning。该增强提升了纯Q-learning的性能。我们相信QM-learning也可用于进一步提升较大游戏中强化学习的性能,这将在未来工作中测试。

关键词

引用

@article{arxiv.1802.05944,
  title  = {Monte Carlo Q-learning for General Game Playing},
  author = {Hui Wang and Michael Emmerich and Aske Plaat},
  journal= {arXiv preprint arXiv:1802.05944},
  year   = {2018}
}