融合具有不同偏差-方差权衡的确定性策略梯度估计以实现高效深度强化学习
机器学习
2020-05-05 v3 机器学习
摘要
在具有连续动作空间的马尔可夫决策过程 (MDPs) 上的深度强化学习 (DRL) 通常沿估计的策略梯度 (PGs) 方向直接训练参数化策略。先前的研究表明,这些 PG 算法的性能严重依赖于估计和使用 PGs 中所涉及的偏差-方差权衡。平衡该权衡的一个显著方法是融合同策略与异策略梯度估计。然而,现有的 PG 融合方法样本效率低,且不适合直接训练确定性策略。为解决这些问题,本文引入精英 PGs,并通过采用精英保留与策略巩固技术,基于从精英轨迹提取的策略行为知识来正则化策略训练,从而增强其方差缩减效果。同时,我们提出一种两步方法,将精英 PGs 与常规 PGs 相融合,作为常规插值融合方法的新扩展。在理论与实验两个层面,我们表明两步融合与插值融合均能在策略训练过程中诱导出不同的偏差-方差权衡。它们使我们能够有效利用精英 PGs 并减轻其对训练后策略的性能影响。我们的实验还表明,在六个基准控制任务上,两步融合优于插值融合及若干最先进算法。
引用
@article{arxiv.1911.10527,
title = {Merging Deterministic Policy Gradient Estimations with Varied Bias-Variance Tradeoff for Effective Deep Reinforcement Learning},
author = {Gang Chen},
journal= {arXiv preprint arXiv:1911.10527},
year = {2020}
}