中文

深度强化学习算法中用于克服过高估计的一些方法

机器学习 2022-11-11 v2 机器学习

摘要

本文讨论了多位作者在深度强化学习(RL)算法框架下研究所涉及的与统计噪声相关的若干现象。考察了以下算法:深度 Q 网络(DQN)、双重 DQN、深度确定性策略梯度(DDPG)、双延迟 DDPG(TD3)以及爬山算法。首先,我们考虑过高估计,这是由噪声导致的一种有害特性。接着我们处理用于探索的噪声,即有用的噪声。我们讨论了在 TD3 中为与 articulated bodies 相关的典型 PyBullet 环境(如 HopperBulletEnv 和 Walker2DBulletEnv)设置噪声参数。在附录中,针对爬山算法,考虑了另一个与噪声相关的例子——一个自适应噪声的例子。

关键词

引用

@article{arxiv.2006.14167,
  title  = {Some approaches used to overcome overestimation in Deep Reinforcement Learning algorithms},
  author = {Rafael Stekolshchik},
  journal= {arXiv preprint arXiv:2006.14167},
  year   = {2022}
}

备注

9 pages, 5 figures