深度与非线性诱导强化学习的隐式探索
机器学习
2018-05-31 v1 人工智能
机器学习
摘要
如何探索,即采取结果不确定的动作以了解未来可能的奖励,是强化学习(RL)中的一个关键问题。本文展示了一个令人惊讶的结果:我们表明,使用非线性 Q 函数且无需显式探索(即纯贪婪策略)的 Q-learning 能够学习若干标准基准任务,包括山地车,其效果与最常用的 -贪婪探索相当甚至更好。我们仔细检验了这一结果,并表明 Q 网络的深度与非线性的类型对于诱导此种确定性探索都十分重要。
引用
@article{arxiv.1805.11711,
title = {Depth and nonlinearity induce implicit exploration for RL},
author = {Justas Dauparas and Ryota Tomioka and Katja Hofmann},
journal= {arXiv preprint arXiv:1805.11711},
year = {2018}
}