中文

通过异步优势 actor-critic 算法玩 Flappy Bird

机器学习 2019-07-09 v1 神经与进化计算

摘要

Flappy Bird 具有极高人气,已被许多算法训练过。其中一些研究从游戏的原始像素值训练,另一些从特定属性训练。本研究中,模型使用此前未接触过的原始游戏图像进行训练。训练后的模型以强化学习方式学习了在何时做出何种决策。作为模型输入,每步结束时的奖励或惩罚被返回并完成训练。Flappy Bird 游戏使用强化学习算法 Deep Q-Network 和异步优势 Actor-Critic(A3C)算法进行了训练。

关键词

引用

@article{arxiv.1907.03098,
  title  = {Playing Flappy Bird via Asynchronous Advantage Actor Critic Algorithm},
  author = {Elit Cenk Alp and Mehmet Serdar Guzel},
  journal= {arXiv preprint arXiv:1907.03098},
  year   = {2019}
}

备注

8 pages , 7 figures