深度强化学习算法中用于克服过高估计的一些方法
机器学习
2022-11-11 v2 机器学习
摘要
本文讨论了多位作者在深度强化学习(RL)算法框架下研究所涉及的与统计噪声相关的若干现象。考察了以下算法:深度 Q 网络(DQN)、双重 DQN、深度确定性策略梯度(DDPG)、双延迟 DDPG(TD3)以及爬山算法。首先,我们考虑过高估计,这是由噪声导致的一种有害特性。接着我们处理用于探索的噪声,即有用的噪声。我们讨论了在 TD3 中为与 articulated bodies 相关的典型 PyBullet 环境(如 HopperBulletEnv 和 Walker2DBulletEnv)设置噪声参数。在附录中,针对爬山算法,考虑了另一个与噪声相关的例子——一个自适应噪声的例子。
引用
@article{arxiv.2006.14167,
title = {Some approaches used to overcome overestimation in Deep Reinforcement Learning algorithms},
author = {Rafael Stekolshchik},
journal= {arXiv preprint arXiv:2006.14167},
year = {2022}
}
备注
9 pages, 5 figures