深度质量-价值(DQV)学习
机器学习
2018-10-11 v2 机器学习
摘要
我们引入一种称为深度质量-价值(DQV)学习的新型深度强化学习(DRL)算法。DQV利用时序差分学习来训练一个价值神经网络,并借助该网络训练第二个质量-价值网络以学习估计状态-动作价值。我们首先以多层感知机作为函数逼近器,在两个经典RL问题上测试DQV的更新规则,随后将DQV扩展使用深度卷积神经网络、'经验回放'与'目标神经网络'以应对Atari Arcade Learning环境中的四款游戏。我们的结果表明,DQV的学习显著快于且优于Deep Q-Learning与Double Deep Q-Learning,意味着我们的算法有可能成为优于当前DRL中已有算法的同步时序差分算法。
引用
@article{arxiv.1810.00368,
title = {Deep Quality-Value (DQV) Learning},
author = {Matthia Sabatelli and Gilles Louppe and Pierre Geurts and Marco A. Wiering},
journal= {arXiv preprint arXiv:1810.00368},
year = {2018}
}