中文

理解多步深度强化学习:对 DQN 目标的系统性研究

机器学习 2019-02-11 v2 机器学习

摘要

Retrace(λ\lambda) 和 nnQQ-学习等多步方法已成为现代深度强化学习智能体的关键组成部分。这些方法通常作为更大架构的一部分进行评估,且其评估很少包含足够样本以得出关于其性能的统计显著结论。这类方法论使得理解多步方法的特定算法细节如何影响学习变得困难。在本文中,我们将 nn 步动作值算法 Retrace、 QQ-学习、Tree Backup、Sarsa 和 Q(σ)Q(\sigma) 与类似于 DQN 的架构相结合。我们在山地车环境中测试了所有这些算法的性能;该环境的选择允许更快的训练时间和更大的样本量。我们针对离策略修正、备份长度参数 nn 以及目标网络更新频率对这些算法性能的影响进行了统计分析。我们的结果表明:(1) 使用离策略修正会对 Sarsa 和 Q(σ)Q(\sigma) 的性能产生不利影响;(2) 增加备份长度 nn 在所有不同算法中一致地改善了性能;(3) 在该特定任务中,Sarsa 和 QQ-学习的性能比 Tree Backup、Q(σ)Q(\sigma) 和 Retrace 的性能对目标网络更新频率的影响更具鲁棒性。

关键词

引用

@article{arxiv.1901.07510,
  title  = {Understanding Multi-Step Deep Reinforcement Learning: A Systematic Study of the DQN Target},
  author = {J. Fernando Hernandez-Garcia and Richard S. Sutton},
  journal= {arXiv preprint arXiv:1901.07510},
  year   = {2019}
}