中文

用于偏差缓解的值激活:广义激活深度双确定性策略梯度

机器学习 2021-12-22 v1 人工智能

摘要

在深度强化学习(DRL)中准确估计值函数至关重要,以使智能体执行恰当动作而非次优动作。然而,现有actor-critic方法或多或少受到低估偏差或高估偏差的困扰,对其性能产生负面影响。本文中,我们揭示了一个简单而有效的原则:适当的值校正有益于偏差缓解,其中我们提出了广义激活加权算子,该算子使用任意非递减函数(即激活函数)作为权重以获得更好的值估计。特别地,我们将广义激活加权算子整合进值估计,并引入一种新算法——广义激活深度双确定性策略梯度(GD3)。我们从理论上表明GD3能够缓解潜在的估计偏差。我们有趣地发现,简单的激活函数无需额外技巧即可带来令人满意的性能,并有助于更快收敛。在众多具挑战性的连续控制任务上的实验结果表明,带有任务特定激活的GD3优于常见基线方法。我们还揭示了一个事实:微调多项式激活函数在大多数任务上取得了更优结果。

关键词

引用

@article{arxiv.2112.11216,
  title  = {Value Activation for Bias Alleviation: Generalized-activated Deep Double Deterministic Policy Gradients},
  author = {Jiafei Lyu and Yu Yang and Jiangpeng Yan and Xiu Li},
  journal= {arXiv preprint arXiv:2112.11216},
  year   = {2021}
}

备注

13 pages