面向基于回报深度 Q 网络策略差异的定性度量
机器学习
2019-12-02 v3 人工智能
机器学习
摘要
深度 Q 网络(DQN)和基于回报的强化学习是近年来提出的两种有前景的算法。DQN 为复杂序贯决策问题带来进展,而基于回报的算法在利用样本轨迹方面具有优势。本文中,我们提出一个结合 DQN 与大多数基于回报的强化学习算法的通用框架,称为 R-DQN。我们表明,通过引入基于回报的强化学习,传统 DQN 的性能可得到有效提升。为了进一步改进 R-DQN,我们设计了一种带有两个度量的策略,可定性度量策略差异。此外,我们给出了所提 R-DQN 框架中两个度量的界限。我们表明,采用我们策略的算法能准确表达迹系数并实现对回报更好的近似。在 OpenAI Gym 库若干代表性任务上进行的实验验证了所提度量的有效性。结果还表明,采用我们策略的算法优于最先进的方法。
引用
@article{arxiv.1806.06953,
title = {Qualitative Measurements of Policy Discrepancy for Return-Based Deep Q-Network},
author = {Wenjia Meng and Qian Zheng and Long Yang and Pengfei Li and Gang Pan},
journal= {arXiv preprint arXiv:1806.06953},
year = {2019}
}