通过异步优势 actor-critic 算法玩 Flappy Bird
机器学习
2019-07-09 v1 神经与进化计算
摘要
Flappy Bird 具有极高人气,已被许多算法训练过。其中一些研究从游戏的原始像素值训练,另一些从特定属性训练。本研究中,模型使用此前未接触过的原始游戏图像进行训练。训练后的模型以强化学习方式学习了在何时做出何种决策。作为模型输入,每步结束时的奖励或惩罚被返回并完成训练。Flappy Bird 游戏使用强化学习算法 Deep Q-Network 和异步优势 Actor-Critic(A3C)算法进行了训练。
引用
@article{arxiv.1907.03098,
title = {Playing Flappy Bird via Asynchronous Advantage Actor Critic Algorithm},
author = {Elit Cenk Alp and Mehmet Serdar Guzel},
journal= {arXiv preprint arXiv:1907.03098},
year = {2019}
}
备注
8 pages , 7 figures