中文

动态跳帧深度Q网络

机器学习 2020-09-23 v3 人工智能 神经与进化计算

摘要

深度强化学习方法在Atari 2600领域的游戏控制策略学习中已取得了最先进的性能。街机学习环境(Arcade Learning Environment, ALE)中的一个重要参数是跳帧率。它决定了智能体控制游戏玩的粒度。跳帧值 kk 允许智能体将所选动作重复 kk 次。当前最先进的架构如深度Q网络(Deep Q-Network, DQN)和决斗网络架构(Dueling Network Architectures, DuDQN)由一个具有静态跳帧率的框架组成,其中网络输出的动作无论当前状态如何都会重复固定帧数。在本文中,我们提出一种新的架构,动态跳帧深度Q网络(Dynamic Frame skip Deep Q-Network, DFDQN),它将跳帧率变为一个动态可学习参数。这使我们能基于当前状态选择动作重复的次数。我们通过实验表明,这样的设置提升了在如Seaquest等相对较难游戏上的性能。

关键词

引用

@article{arxiv.1605.05365,
  title  = {Dynamic Frame skip Deep Q Network},
  author = {Aravind Srinivas and Sahil Sharma and Balaraman Ravindran},
  journal= {arXiv preprint arXiv:1605.05365},
  year   = {2020}
}

备注

IJCAI 2016 Workshop on Deep Reinforcement Learning: Frontiers and Challenges; 6 pages, 8 figures