中文

多步方法对深度强化学习中过高估计的影响

人工智能 2020-06-24 v1

摘要

强化学习(RL)中的多步(亦称 n 步)方法由于在利用值函数表格表示的任务中能更快传播奖励信号,已被证明比 1 步方法更高效,这在理论和实证上均得到验证。近期,深度强化学习(DRL)的研究也表明,在值函数与策略由深度神经网络表示的应用中,多步方法提升了学习速度与最终性能。然而,对于究竟是什么促成了性能提升仍缺乏理解。本工作中,我们分析了多步方法对缓解 DRL 中过高估计问题的影响,其中多步经验从回放缓冲区采样。具体而言,在深度确定性策略梯度(DDPG)基础上,我们提出多步 DDPG(MDDPG),其手动设定不同步长,以及其变体混合多步 DDPG(MMDDPG),后者使用对不同多步备份的平均作为 Q 值函数的更新目标。通过实证,我们表明 MDDPG 与 MMDDPG 受过高估计问题的影响均显著小于采用 1 步备份的 DDPG,从而带来更好的最终性能与学习速度。我们还讨论了为减小近似误差而采用不同多步展开方式的优劣,并揭示了离线多步方法背后过高估计与过低估计之间的权衡。最后,由于双延迟深度确定性策略梯度(TD3)——一种为解决 actor-critic 方法中过高估计而提出的前沿算法——与我们提出的方法展现出相当的最终性能与学习速度,我们比较了二者的计算资源需求。

关键词

引用

@article{arxiv.2006.12692,
  title  = {The Effect of Multi-step Methods on Overestimation in Deep Reinforcement Learning},
  author = {Lingheng Meng and Rob Gorbet and Dana Kulić},
  journal= {arXiv preprint arXiv:2006.12692},
  year   = {2020}
}

备注

7 pages, 4 figures, the 25th International Conference on Pattern Recognition (ICPR)