中文

将双重 Q 学习适配于连续强化学习

机器学习 2023-09-27 v1 人工智能

摘要

大多数离策略(off-policy)强化学习算法使用过高估计偏差控制技术。这些技术大多根植于启发式方法,主要处理过高估计的后果而非其根本来源。本工作中我们提出一种类似于双重 Q 学习(Double Q-Learning)精神的偏差校正新方法。我们提出使用由两部分组成的混合形式策略。每个策略分量由独立网络最大化与评估,从而消除了过高估计偏差的任何基础。我们的方法在一小组 MuJoCo 环境上展示了有前景的近 SOTA 结果。

关键词

引用

@article{arxiv.2309.14471,
  title  = {Adapting Double Q-Learning for Continuous Reinforcement Learning},
  author = {Arsenii Kuznetsov},
  journal= {arXiv preprint arXiv:2309.14471},
  year   = {2023}
}