中文

基于 N 元组强化学习求解魔方的研究

机器学习 2023-01-31 v1 人工智能

摘要

本文详细描述了在通用棋类游戏(GBG)学习与对弈框架中如何学习并求解魔方游戏(或拼图)。我们涵盖了 2x2x2 与 3x3x3 尺寸的魔方。我们详细描述了魔方的状态表示、如何通过转动、整体立方体旋转与颜色变换对其进行变换,并解释了魔方中对称性的使用。接下来,我们讨论了针对魔方的不同 n 元组表示、如何通过强化学习训练智能体,以及如何在评估阶段通过 MCTS 封装改进训练后的智能体。我们给出了从零开始学习魔方的智能体的结果,包含有无 MCTS 封装、有无对称性的情况,并表明 MCTS 封装与对称性二者均会增加计算成本,但同时带来好得多的结果。我们能够完全求解 2x2x2 魔方,对于打乱步数至多 p = 15(QTM)的 3x3x3 魔方在多数情况下可解。我们尚不能可靠地求解打乱转动超过 15 步的 3x3x3 魔方。尽管采用 MCTS 封装与对称性时的计算成本高于不采用时,但仍显著低于 McAleer 等人(2018, 2019)与 Agostinelli 等人(2019)的方法,他们提供了迄今为止最好的魔方学习智能体。

关键词

引用

@article{arxiv.2301.12167,
  title  = {Towards Learning Rubik's Cube with N-tuple-based Reinforcement Learning},
  author = {Wolfgang Konen},
  journal= {arXiv preprint arXiv:2301.12167},
  year   = {2023}
}

备注

43 pages