中文

重新审视深度强化学习中策略梯度的估计偏差

机器学习 2023-02-13 v2 人工智能

摘要

我们从深度强化学习(DRL)视角重新审视折扣片段式马尔可夫决策过程(MDP)中策略梯度的估计偏差。该目标在理论上被表述为随时间范围折扣的期望回报。策略梯度的主要偏差之一是状态分布偏移:用于估计梯度的状态分布与理论表述不同,在于其未考虑折扣因子。现有文献对该偏差影响的讨论仅限于表格和softmax情形。因此,在本文中我们将其扩展到策略被参数化的DRL设定,并从理论上展示该偏差如何导致次优策略。然后我们讨论为何具有偏移状态分布的、经验上不准确的实现仍然有效。我们表明,尽管存在此种状态分布偏移,策略梯度估计偏差可通过以下三种方式减小:1)小学习率;2)基于自适应学习率的优化器;3)KL正则化。具体而言,我们展示较小的学习率,或自适应学习率(如Adam和RMSProp优化器所用的),使策略优化对该偏差具有鲁棒性。我们进一步建立优化器与优化正则化之间的联系,以表明KL与反向KL正则化均可显著纠正该偏差。此外,我们在连续控制任务上提供了大量实验以支持我们的分析。我们的论文阐明了成功的PG算法如何在DRL设定中优化策略,并为DRL中的实际问题贡献了见解。

关键词

引用

@article{arxiv.2301.08442,
  title  = {Revisiting Estimation Bias in Policy Gradients for Deep Reinforcement Learning},
  author = {Haoxuan Pan and Deheng Ye and Xiaoming Duan and Qiang Fu and Wei Yang and Jianping He and Mingfei Sun},
  journal= {arXiv preprint arXiv:2301.08442},
  year   = {2023}
}

备注

12 pages, 9 figures