通过基于学习模型的规划掌握 Atari、围棋、国际象棋与将棋
机器学习
2021-01-27 v2 机器学习
摘要
构建具备规划能力的智能体一直是人工智能追求中的主要挑战之一。基于树的规划方法在象棋和围棋等存在完美模拟器的困难领域中取得了巨大成功。然而,在现实世界问题中,支配环境的动力学往往复杂且未知。在本工作中,我们提出 MuZero 算法,该算法通过将基于树的搜索与学习得到的模型相结合,在一系列具有挑战性且视觉复杂的领域中实现了超越人类的表现,而无需任何关于其底层动力学的知识。MuZero 学习一个模型,该模型在迭代应用时预测与规划最直接相关的量:奖励、动作选择策略和价值函数。在 57 款不同的 Atari 游戏(用于测试 AI 技术的经典视频游戏环境,基于模型的规划方法历来在此举步维艰)上进行评估时,我们的新算法达到了新的 SOTA。在无需任何游戏规则知识的情况下对围棋、国际象棋和将棋进行评估时,MuZero 匹配了被提供游戏规则的 AlphaZero 算法的超人类表现。
引用
@article{arxiv.1911.08265,
title = {Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model},
author = {Julian Schrittwieser and Ioannis Antonoglou and Thomas Hubert and Karen Simonyan and Laurent Sifre and Simon Schmitt and Arthur Guez and Edward Lockhart and Demis Hassabis and Thore Graepel and Timothy Lillicrap and David Silver},
journal= {arXiv preprint arXiv:1911.08265},
year = {2021}
}