中文

确定性Actor-Critic方法中深度强化学习的估计误差校正

机器学习 2021-12-28 v2 人工智能 机器学习

摘要

在基于价值的深度强化学习方法中,价值函数的近似会引入过高估计偏差并导致次优策略。我们表明,在旨在克服过高估计偏差的深度actor-critic方法中,若智能体接收到的强化信号具有较高方差,则会出现显著的过低估计偏差。为最小化该过低估计,我们引入了一种无参数的新型深度Q学习变体。我们的Q值更新规则结合了Clipped Double Q-learning与Maxmin Q-learning背后的思想,通过最大与最小算子的嵌套组合来计算评论家目标,从而界定近似价值估计。我们在多个OpenAI Gym连续控制任务套件上评估了我们的改进,在每一个测试环境中均提升了当前最优水平。

关键词

引用

@article{arxiv.2109.10736,
  title  = {Estimation Error Correction in Deep Reinforcement Learning for Deterministic Actor-Critic Methods},
  author = {Baturay Saglam and Enes Duran and Dogan C. Cicek and Furkan B. Mutlu and Suleyman S. Kozat},
  journal= {arXiv preprint arXiv:2109.10736},
  year   = {2021}
}