中文

深度与非线性诱导强化学习的隐式探索

机器学习 2018-05-31 v1 人工智能 机器学习

摘要

如何探索,即采取结果不确定的动作以了解未来可能的奖励,是强化学习(RL)中的一个关键问题。本文展示了一个令人惊讶的结果:我们表明,使用非线性 Q 函数且无需显式探索(即纯贪婪策略)的 Q-learning 能够学习若干标准基准任务,包括山地车,其效果与最常用的 ϵ\epsilon-贪婪探索相当甚至更好。我们仔细检验了这一结果,并表明 Q 网络的深度与非线性的类型对于诱导此种确定性探索都十分重要。

关键词

引用

@article{arxiv.1805.11711,
  title  = {Depth and nonlinearity induce implicit exploration for RL},
  author = {Justas Dauparas and Ryota Tomioka and Katja Hofmann},
  journal= {arXiv preprint arXiv:1805.11711},
  year   = {2018}
}