中文

周期性Q学习

机器学习 2020-02-25 v1 最优化与控制 机器学习

摘要

使用目标网络是深度强化学习中稳定训练的常用做法;然而,对该技术的理论理解仍然有限。本文中,我们研究所谓的周期性Q学习算法(简称PQ-learning),它类似于深度Q学习中用于求解表格环境下无限 horizon 折扣马尔可夫决策过程(DMDP)的技术。PQ-learning维护两个分离的Q值估计——在线估计与目标估计。在线估计遵循标准Q学习更新,而目标估计被周期性更新。与标准Q学习相比,PQ-learning具有简单的有限时间分析,并在寻找epsilon最优策略上取得更好的样本复杂度。我们的结果为在Q学习算法中利用目标估计或网络的有效性提供了初步论证。

关键词

引用

@article{arxiv.2002.09795,
  title  = {Periodic Q-Learning},
  author = {Donghwan Lee and Niao He},
  journal= {arXiv preprint arXiv:2002.09795},
  year   = {2020}
}