中文

利用强化学习求解皇家游戏乌尔

机器学习 2022-08-24 v1 人工智能

摘要

强化学习(Reinforcement Learning, RL)近来已成为解决棋盘游戏领域复杂问题的一种非常强大的工具,其中通常要求智能体基于自身经验与所获奖励来学习复杂策略与走法。尽管RL已在简单视频游戏与流行棋盘游戏中超越现有最优方法,但其在古老游戏上的能力尚待证明。在此,我们解决这样一个问题:使用蒙特卡洛、Q学习(Q-learning)与期望Sarsa(Expected Sarsa)等不同方法训练智能体,以学习游玩策略性皇家游戏乌尔(Royal Game of Ur)的最优策略。我们游戏的状态空间复杂且庞大,但我们的智能体在游玩游戏与学习重要策略性走法上展现出有前景的结果。尽管难以断定在有限资源训练下哪种算法总体表现更优,但期望Sarsa在学习速度最快方面展现出有前景的结果。

关键词

引用

@article{arxiv.2208.10669,
  title  = {Solving Royal Game of Ur Using Reinforcement Learning},
  author = {Sidharth Malhotra and Girik Malik},
  journal= {arXiv preprint arXiv:2208.10669},
  year   = {2022}
}