中文

面向约束满足博弈智能体的强化学习(15数码、扫雷、2048 与数独)

机器学习 2021-10-08 v1 人工智能

摘要

近年来,由于深度 Q 学习(其中模型为卷积神经网络),强化学习受到了关注。深度 Q 学习在 Atari 和 AlphaGo 等游戏中显示出有前景的结果。它不学习整个 Q 表,而是学习决定状态策略动作的 Q 函数的估计。我们使用 Q 学习和深度 Q 学习来学习四种约束满足博弈(15数码、扫雷、2048 和数独)的控制策略。15数码是一种滑动置换谜题,其在应对巨大状态空间方面提出了挑战。扫雷和数独涉及部分可观测状态与猜测。2048 也是一种滑动谜题,但允许更简单的状态表示(相较于 15数码),并使用了有趣的奖励塑形来解决该游戏。这些游戏为强化学习的潜力与局限提供了独特的见解。Q 智能体在没有任何游戏规则的情况下训练,仅依靠每个状态动作对应的奖励。我们的独特贡献在于选择奖励结构、状态表示以及深度神经网络的构建。对于低乱序的 15数码,达到 100% 胜率,中乱序和高乱序分别约为 43% 和 22% 的胜率。在标准 16x16 扫雷棋盘上,低密度和高密度棋盘均接近 45% 胜率,而中等密度棋盘胜率较低,为 15%。对于 2048,1024 胜率极易达到(100%),2048、4096、8192 和 16384 的胜率分别为 40%、0.05%、0.01% 和 0.004%。简单数独游戏胜率为 7%,中等和困难游戏胜率分别为 2.1% 和 1.2%。本文通过可让我们更接近理解人类学习方式的奖励结构,探索了一类约束博弈的环境复杂性与行为。

关键词

引用

@article{arxiv.2102.06019,
  title  = {Reinforcement Learning For Constraint Satisfaction Game Agents (15-Puzzle, Minesweeper, 2048, and Sudoku)},
  author = {Anav Mehta},
  journal= {arXiv preprint arXiv:2102.06019},
  year   = {2021}
}