中文

具有经验回放的采样高效 Actor-Critic

机器学习 2017-07-11 v2

摘要

本文提出了一种带有经验回放的 actor-critic 深度强化学习智能体,该智能体稳定、采样高效,并在具有挑战性的环境中表现极为出色,包括离散的 57 游戏 Atari 领域和若干连续控制问题。为此,本文引入了多项创新,包括带偏差校正的截断重要性采样、随机对决网络架构,以及一种新的信赖域策略优化方法。

关键词

引用

@article{arxiv.1611.01224,
  title  = {Sample Efficient Actor-Critic with Experience Replay},
  author = {Ziyu Wang and Victor Bapst and Nicolas Heess and Volodymyr Mnih and Remi Munos and Koray Kavukcuoglu and Nando de Freitas},
  journal= {arXiv preprint arXiv:1611.01224},
  year   = {2017}
}

备注

20 pages. Prepared for ICLR 2017