近似两个值函数而非一个:刻画一类新型深度强化学习算法
机器学习
2019-10-15 v2 人工智能
机器学习
摘要
本文在向刻画一类新型无模型深度强化学习(DRL)算法方面迈出了一步。这些算法的目标是联合学习状态值函数()的近似与状态-动作值函数()的近似。我们的分析从对深度质量-值学习(DQV)算法的深入研究开始,该DRL算法已被证明优于深度Q学习(DQN)和双重深度Q学习(DDQN)等流行技术\cite{sabatelli2018deep}。为探究为何DQV的学习动态使该算法表现如此良好,我们提出了一组研究问题,有助于刻画一类新型DRL算法。在我们的结果中,我们给出了DQV性能可能受损的一些具体情况,并引入了一种称为DQV-Max的新型离策略DRL算法,其性能可超越DQV。随后我们研究了DQV与DQV-Max所学习的与函数的行为,并表明这两种算法在多个DRL测试平台上表现良好,可能是因为它们较不易遭受函数的过高估计偏差。
引用
@article{arxiv.1909.01779,
title = {Approximating two value functions instead of one: towards characterizing a new family of Deep Reinforcement Learning algorithms},
author = {Matthia Sabatelli and Gilles Louppe and Pierre Geurts and Marco A. Wiering},
journal= {arXiv preprint arXiv:1909.01779},
year = {2019}
}