中文

无参数降低确定性策略梯度深度强化学习中的估计偏差

机器学习 2022-05-20 v3 人工智能 机器学习

摘要

基于价值的深度强化学习中价值函数的近似会引起过高估计偏差,导致次优策略。我们表明,当智能体接收到的强化信号具有较方差时,克服过高估计偏差的深度 actor-critic 方法会导致显著的低估偏差。我们首先解决现有旨在克服此类低估误差方法中的有害问题。然后,通过广泛的统计分析,我们引入了一种新颖的、无参数的 Deep Q-learning 变体,以降低确定性策略梯度中的这种低估偏差。通过从高度收缩的估计偏差区间中采样两个近似评论家线性组合的权重,我们的 Q 值更新规则不受智能体在整个学习过程中接收到的奖励方差的影响。我们在一组 MuJoCo 和 Box2D 连续控制任务上测试了所引入改进的性能,并证明它显著优于现有方法,并以显著幅度提升了最先进水平。

关键词

引用

@article{arxiv.2109.11788,
  title  = {Parameter-free Reduction of the Estimation Bias in Deep Reinforcement Learning for Deterministic Policy Gradients},
  author = {Baturay Saglam and Furkan Burak Mutlu and Dogan Can Cicek and Suleyman Serdar Kozat},
  journal= {arXiv preprint arXiv:2109.11788},
  year   = {2022}
}