具有经验回放的采样高效 Actor-Critic
机器学习
2017-07-11 v2
摘要
本文提出了一种带有经验回放的 actor-critic 深度强化学习智能体,该智能体稳定、采样高效,并在具有挑战性的环境中表现极为出色,包括离散的 57 游戏 Atari 领域和若干连续控制问题。为此,本文引入了多项创新,包括带偏差校正的截断重要性采样、随机对决网络架构,以及一种新的信赖域策略优化方法。
引用
@article{arxiv.1611.01224,
title = {Sample Efficient Actor-Critic with Experience Replay},
author = {Ziyu Wang and Victor Bapst and Nicolas Heess and Volodymyr Mnih and Remi Munos and Koray Kavukcuoglu and Nando de Freitas},
journal= {arXiv preprint arXiv:1611.01224},
year = {2017}
}
备注
20 pages. Prepared for ICLR 2017