GAN Q-learning
机器学习
2018-07-24 v3 机器学习
摘要
分布强化学习(distributional RL)在非线性函数近似设定下的复杂马尔可夫决策过程(MDPs)中已见到经验成功。然而,利用分布式方法进行强化学习有许多不同的方式。在本文中,我们提出 GAN Q-learning,一种基于生成对抗网络(GANs)的新型分布强化学习方法,并分析了其在简单表格环境以及 OpenAI Gym 中的性能。我们经验性地表明,我们的算法利用了深度学习模型的灵活性和黑箱方法,同时提供了对传统方法的可行替代。
引用
@article{arxiv.1805.04874,
title = {GAN Q-learning},
author = {Thang Doan and Bogdan Mazoure and Clare Lyle},
journal= {arXiv preprint arXiv:1805.04874},
year = {2018}
}