中文

基于集成深度确定性策略梯度的连续控制

机器学习 2021-12-01 v1 人工智能

摘要

深度强化学习(RL)的发展为该领域带来了多种令人振奋的工具与方法。这种快速扩展使得理解RL工具箱中各个元素之间的相互作用变得重要。我们从经验视角出发,在连续控制设定下开展研究以完成此任务。我们提出了多项基础性的见解,包括:对同一数据训练出的多个 actor 取平均可提升性能;现有方法在训练运行、训练轮次和评估运行间不稳定;常用的加性动作噪声对于有效训练并非必需;基于后验采样的策略比近似UCB结合加权Bellman备份探索得更好;仅用加权Bellman备份无法替代裁剪双Q学习;critic的初始化在基于集成的actor-critic探索中起主要作用。作为结论,我们展示了如何以新颖方式将现有工具组合在一起,从而产生集成深度确定性策略梯度(ED2)方法,在OpenAI Gym MuJoCo的连续控制任务上取得最先进结果。从实践角度看,ED2概念直接、易于编码,且不需要现有RL工具箱之外的知识。

关键词

引用

@article{arxiv.2111.15382,
  title  = {Continuous Control With Ensemble Deep Deterministic Policy Gradients},
  author = {Piotr Januszewski and Mateusz Olko and Michał Królikowski and Jakub Świątkowski and Marcin Andrychowicz and Łukasz Kuciński and Piotr Miłoś},
  journal= {arXiv preprint arXiv:2111.15382},
  year   = {2021}
}