中文

通过通用强化学习算法的自我对弈掌握国际象棋与将棋

人工智能 2017-12-06 v1 机器学习

摘要

国际象棋是人工智能历史上被研究最广泛的领域。最强的程序基于复杂的搜索技术、领域特定的适配以及由人类专家在数十年间精炼的手工评估函数的组合。相比之下,AlphaGo Zero 程序最近通过来自自我对弈的从头强化学习,在围棋中取得了超越人类的表现。本文将此方法推广为单一的 AlphaZero 算法,能够在许多具有挑战性的领域中从头实现超越人类的表现。从随机走子开始,且在除游戏规则外无任何领域知识的情况下,AlphaZero 在 24 小时内于国际象棋、将棋(日本象棋)以及围棋中达到了超越人类水平的对弈能力,并在每种情况下均令人信服地击败了世界冠军级程序。

关键词

引用

@article{arxiv.1712.01815,
  title  = {Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm},
  author = {David Silver and Thomas Hubert and Julian Schrittwieser and Ioannis Antonoglou and Matthew Lai and Arthur Guez and Marc Lanctot and Laurent Sifre and Dharshan Kumaran and Thore Graepel and Timothy Lillicrap and Karen Simonyan and Demis Hassabis},
  journal= {arXiv preprint arXiv:1712.01815},
  year   = {2017}
}