中文

用于 2048 类游戏的多阶段时序差分学习

机器学习 2016-07-20 v2

摘要

Szubert 和 Jaskowski 成功地将时序差分(TD)学习与 n-tuple 网络结合用于玩 2048 游戏。然而,我们观察到基于 TD 学习的程序仍然很难达到大数字方块。在本文中,我们提出多阶段 TD(MS-TD)学习,这是一种分层强化学习方法,旨在有效提高达到大数字方块的比率,这是分析 2048 程序强度的重要指标。我们的实验表明,与未使用 MS-TD 学习相比,性能有显著提升。即,使用 3 层 expectimax 搜索,采用 MS-TD 学习的程序达到 32768 方块的比率为 18.31%,而采用 TD 学习的程序则未能达到任何 32768 方块。经过进一步调优,我们的 2048 程序在 10,000 局游戏中达到 32768 方块的比率为 31.75%,其中一局甚至达到了 65536 方块,据我们所知这是首次达到 65536 方块。此外,MS-TD 学习方法可以轻松应用于其他 2048 类游戏,例如 Threes。基于 MS-TD 学习,我们在 Threes 上的实验也展示了类似的性能提升,采用 MS-TD 学习的程序达到 6144 方块的比率为 7.83%,而采用 TD 学习的程序仅为 0.45%。

关键词

引用

@article{arxiv.1606.07374,
  title  = {Multi-Stage Temporal Difference Learning for 2048-like Games},
  author = {Kun-Hao Yeh and I-Chen Wu and Chu-Hsuan Hsueh and Chia-Chuan Chang and Chao-Chin Liang and Han Chiang},
  journal= {arXiv preprint arXiv:1606.07374},
  year   = {2016}
}

备注

The version has been accepted by TCIAIG (The first version was sent on 23, October, 2015)