中文

面向 2048 的乐观时序差分学习

人工智能 2021-11-23 v1 机器学习

摘要

时序差分 (TD) 学习及其变体,如多阶段 TD (MS-TD) 学习和时间相干 (TC) 学习,已成功应用于 2048。这些方法依赖 2048 环境的随机性进行探索。在本文中,我们提出采用乐观初始化 (OI) 来鼓励 2048 中的探索,并经验性地表明学习质量得到显著提升。该方法将特征权重乐观地初始化为非常大的值。由于权重一旦状态被访问往往会降低,智能体倾向于探索那些未被访问或访问次数少的状态。我们的实验表明,带有 OI 的 TD 与 TC 学习均显著提升了性能。结果,达到相同性能所需的网络规模显著减小。借助期望极大值搜索、多阶段学习和降阶技术等额外调优,我们的设计达到了最先进的性能,即平均分数 625 377 以及达到 32768 方块的概率 72%。此外,在足够大规模的测试中,达到 65536 方块的概率为 0.02%。

关键词

引用

@article{arxiv.2111.11090,
  title  = {Optimistic Temporal Difference Learning for 2048},
  author = {Hung Guei and Lung-Pin Chen and I-Chen Wu},
  journal= {arXiv preprint arXiv:2111.11090},
  year   = {2021}
}

备注

Accepted by the IEEE Transactions on Games, September 3, 2021