中文

在无人类知识条件下求解魔方

人工智能 2018-05-22 v1

摘要

一个具备通用智能的智能体必须能够在极少人类监督下,自学如何解决复杂领域中的问题。近来,深度强化学习算法结合自我对弈,在无需人类数据或领域知识的情况下,于围棋、国际象棋和将棋中达到了超人水平。在这些环境中,游戏结束时总会获得奖励;然而,对于许多组合优化环境,奖励是稀疏的,且片段未必能保证终止。我们提出自自学迭代(Autodidactic Iteration):一种新颖的强化学习算法,能够在无人类辅助的情况下自学求解魔方。我们的算法能够求解 100% 的随机打乱魔方,同时取得 30 步的中位求解长度——小于或等于采用人类领域知识的求解器。

关键词

引用

@article{arxiv.1805.07470,
  title  = {Solving the Rubik's Cube Without Human Knowledge},
  author = {Stephen McAleer and Forest Agostinelli and Alexander Shmakov and Pierre Baldi},
  journal= {arXiv preprint arXiv:1805.07470},
  year   = {2018}
}

备注

First three authors contributed equally. Submitted to NIPS 2018