中文

通过延迟时间相干学习、多阶段权重提升、冗余编码与Carousel塑形掌握2048

人工智能 2016-12-13 v3 机器学习

摘要

2048是一款引人入胜的单人、非确定性视频益智游戏,凭借简单的规则和难以精通的玩法,近年来广受欢迎。由于2048可以方便地嵌入离散状态马尔可夫决策过程框架,我们将其视为评估强化学习中现有和新方法的测试平台。旨在开发强大的2048对弈程序,我们采用了带系统n-tuple网络的时序差分学习。我们表明,这一基本方法可通过时间相干学习、带权重提升的多阶段函数逼近器、carousel塑形和冗余编码得到显著改进。此外,我们展示了如何利用n-tuple网络的特征,通过i)延迟(衰减)更新并应用无锁乐观并行以轻松利用多CPU核心,来提高学习过程的算法效率。通过这种方式,我们得以开发出迄今为止已知的最强2048对弈程序,这证实了所引入方法对离散状态马尔可夫决策问题的有效性。

关键词

引用

@article{arxiv.1604.05085,
  title  = {Mastering 2048 with Delayed Temporal Coherence Learning, Multi-Stage Weight Promotion, Redundant Encoding and Carousel Shaping},
  author = {Wojciech Jaśkowski},
  journal= {arXiv preprint arXiv:1604.05085},
  year   = {2016}
}