中文

无需巧妙抽样求解 Rubik's Cube

机器学习 2024-12-02 v1 人工智能

摘要

Rubik's Cube 由于其庞大的状态空间和稀疏的奖励结构,构成了强化学习 (RL) 的重大挑战,因为难以到达具有奖励的状态。以往的研究通过从已解状态传播代价估计并融合搜索技术来解决此问题。但这些方法不同于人类的策略——人类从完全混乱的立方体开始,这在解决通用的稀疏奖励问题时可能比较棘手。本文引入一种新型的 RL 算法,采用策略梯度方法在不依赖近似已解状态抽样的情况下求解 Rubik's Cube。我们的办法利用神经网络预测状态之间的代价模式,使智能体能够直接从混乱状态学习。在本研究中,我们对 2x2x2 Rubik's Cube 进行测试,该立方体被混乱 50,000 次,模型成功解决了超过 99.4% 的情况。值得注意的是,这一成果仅使用了策略网络,而无需像以往方法那样依赖树形搜索,充分展示了其有效性及其在稀疏奖励问题中的潜在应用。

引用

@article{arxiv.2411.19583,
  title  = {Solving Rubik's Cube Without Tricky Sampling},
  author = {Yicheng Lin and Siyu Liang},
  journal= {arXiv preprint arXiv:2411.19583},
  year   = {2024}
}