中文

深度残差强化学习

机器学习 2020-01-27 v3 人工智能 机器学习

摘要

我们重新审视了无模型和基于模型的强化学习设定中的残差算法。我们提出了双向目标网络技术以稳定残差算法,由此得到的残差版 DDPG 在 DeepMind Control Suite 基准测试中显著优于原始 DDPG。此外,我们发现残差算法是解决基于模型规划中分布不匹配问题的有效方法。与现有的 TD(kk) 方法相比,我们基于残差的方法对模型做出了更弱的假设,并带来了更大的性能提升。

关键词

引用

@article{arxiv.1905.01072,
  title  = {Deep Residual Reinforcement Learning},
  author = {Shangtong Zhang and Wendelin Boehmer and Shimon Whiteson},
  journal= {arXiv preprint arXiv:1905.01072},
  year   = {2020}
}

备注

AAMAS 2020