中文

GAN Q-learning

机器学习 2018-07-24 v3 机器学习

摘要

分布强化学习(distributional RL)在非线性函数近似设定下的复杂马尔可夫决策过程(MDPs)中已见到经验成功。然而,利用分布式方法进行强化学习有许多不同的方式。在本文中,我们提出 GAN Q-learning,一种基于生成对抗网络(GANs)的新型分布强化学习方法,并分析了其在简单表格环境以及 OpenAI Gym 中的性能。我们经验性地表明,我们的算法利用了深度学习模型的灵活性和黑箱方法,同时提供了对传统方法的可行替代。

关键词

引用

@article{arxiv.1805.04874,
  title  = {GAN Q-learning},
  author = {Thang Doan and Bogdan Mazoure and Clare Lyle},
  journal= {arXiv preprint arXiv:1805.04874},
  year   = {2018}
}