中文

评估经典 Q-learning 在通用博弈对弈中的潜力

人工智能 2018-10-17 v1

摘要

在 AlphaGo 和 AlphaZero 近期取得突破性成果之后,我们看到深度强化学习和游戏对弈中的通用人工智能(AGI)受到了强烈关注。然而,深度学习资源密集且理论尚不完善。对于小型博弈,简单的经典基于表的 Q-learning 可能仍是为首选算法。通用博弈对弈(GGP)为研究 AGI 的强化学习提供了良好的测试平台。Q-learning 是规范的强化学习方法之一,且已被 Banerjee &\& Stone(IJCAI 2007)用于 GGP。在本文中,我们在 GGP 中针对三种小棋盘博弈(Tic-Tac-Toe、Connect Four、Hex)实现了 Q-learning\footnote{源代码:https://github.com/wh1992v/ggp-rl},以便与 Banerjee 等人进行比较。我们发现 Q-learning 在 GGP 中收敛到高胜率。对于 ϵ\epsilon-贪婪策略,我们提出了首个改进,即动态 ϵ\epsilon 算法。此外,受 Gelly &\& Silver(ICML 2007)启发,我们结合在线搜索(Monte Carlo 搜索)以增强离线学习,并提出了用于 GGP 的 QM-learning。两种改进均提升了经典 Q-learning 的性能。在这项工作中,GGP 使我们能够表明,若辅以适当的增强,经典基于表的 Q-learning 可在小型博弈中表现良好。

关键词

引用

@article{arxiv.1810.06078,
  title  = {Assessing the Potential of Classical Q-learning in General Game Playing},
  author = {Hui Wang and Michael Emmerich and Aske Plaat},
  journal= {arXiv preprint arXiv:1810.06078},
  year   = {2018}
}

备注

arXiv admin note: substantial text overlap with arXiv:1802.05944