确定性Actor-Critic方法中深度强化学习的估计误差校正
机器学习
2021-12-28 v2 人工智能
机器学习
摘要
在基于价值的深度强化学习方法中,价值函数的近似会引入过高估计偏差并导致次优策略。我们表明,在旨在克服过高估计偏差的深度actor-critic方法中,若智能体接收到的强化信号具有较高方差,则会出现显著的过低估计偏差。为最小化该过低估计,我们引入了一种无参数的新型深度Q学习变体。我们的Q值更新规则结合了Clipped Double Q-learning与Maxmin Q-learning背后的思想,通过最大与最小算子的嵌套组合来计算评论家目标,从而界定近似价值估计。我们在多个OpenAI Gym连续控制任务套件上评估了我们的改进,在每一个测试环境中均提升了当前最优水平。
引用
@article{arxiv.2109.10736,
title = {Estimation Error Correction in Deep Reinforcement Learning for Deterministic Actor-Critic Methods},
author = {Baturay Saglam and Enes Duran and Dogan C. Cicek and Furkan B. Mutlu and Suleyman S. Kozat},
journal= {arXiv preprint arXiv:2109.10736},
year = {2021}
}