使用策略梯度学习玩 Pong 游戏
机器学习
2018-07-24 v1 人工智能
机器学习
摘要
强化学习(RL)中的活动围绕学习马尔可夫决策过程(MDP)模型展开,特别是以下参数:状态值 V、状态-动作值 Q 和策略 pi。这些参数通常实现为数组。扩大问题规模意味着扩大数组大小,这将迅速导致计算瓶颈。为此,RL 问题通常被表述为使用手工设计的输入特征来学习特定任务,以抑制数组大小。在本报告中,我们讨论了一种替代的端到端深度强化学习(DRL)方法,其中 DRL 尝试学习通用任务表示,在我们的语境中是指从一系列屏幕快照中学习玩 Pong 游戏,而无需特定于游戏的手工设计特征。我们应用人工神经网络(ANN)来近似 RL 模型的策略。策略网络通过策略梯度(PG)方法,从一系列帧中学习玩 Pong 游戏,除像素信息和分数外无任何额外语义。与传统的表格 RL 方法(其中数组内容具有如 V 或 Q 的明确解释)不同,从策略网络的权重中解释知识内容更为隐晦。在这项工作中,我们尝试了多种深度 ANN 架构,即前馈 ANN (FFNN)、卷积 ANN (CNN) 和异步优势 actor-critic (A3C)。我们还检查了在 DRL 成功学会玩 Pong 游戏前后,隐藏节点的激活以及输入层与隐藏层之间的权重。随后讨论了内部学习机制的见解与未来研究方向。
引用
@article{arxiv.1807.08452,
title = {Learning to Play Pong using Policy Gradient Learning},
author = {Somnuk Phon-Amnuaisuk},
journal= {arXiv preprint arXiv:1807.08452},
year = {2018}
}
备注
19 pages, 9 figures. Expanded from a conference paper titled 'What does a policy network learn after mastering a Pong game?" by the same author. MIWAI 2017 pp. 213-222