中文

深度质量-价值(DQV)学习

机器学习 2018-10-11 v2 机器学习

摘要

我们引入一种称为深度质量-价值(DQV)学习的新型深度强化学习(DRL)算法。DQV利用时序差分学习来训练一个价值神经网络,并借助该网络训练第二个质量-价值网络以学习估计状态-动作价值。我们首先以多层感知机作为函数逼近器,在两个经典RL问题上测试DQV的更新规则,随后将DQV扩展使用深度卷积神经网络、'经验回放'与'目标神经网络'以应对Atari Arcade Learning环境中的四款游戏。我们的结果表明,DQV的学习显著快于且优于Deep Q-Learning与Double Deep Q-Learning,意味着我们的算法有可能成为优于当前DRL中已有算法的同步时序差分算法。

关键词

引用

@article{arxiv.1810.00368,
  title  = {Deep Quality-Value (DQV) Learning},
  author = {Matthia Sabatelli and Gilles Louppe and Pierre Geurts and Marco A. Wiering},
  journal= {arXiv preprint arXiv:1810.00368},
  year   = {2018}
}