将双重 Q 学习适配于连续强化学习
机器学习
2023-09-27 v1 人工智能
摘要
大多数离策略(off-policy)强化学习算法使用过高估计偏差控制技术。这些技术大多根植于启发式方法,主要处理过高估计的后果而非其根本来源。本工作中我们提出一种类似于双重 Q 学习(Double Q-Learning)精神的偏差校正新方法。我们提出使用由两部分组成的混合形式策略。每个策略分量由独立网络最大化与评估,从而消除了过高估计偏差的任何基础。我们的方法在一小组 MuJoCo 环境上展示了有前景的近 SOTA 结果。
引用
@article{arxiv.2309.14471,
title = {Adapting Double Q-Learning for Continuous Reinforcement Learning},
author = {Arsenii Kuznetsov},
journal= {arXiv preprint arXiv:2309.14471},
year = {2023}
}