基于行动者-评论家集成的方法学习跑步
机器学习
2017-12-29 v1
摘要
我们提出了一种行动者-评论家集成(Actor-Critic Ensemble, ACE)方法,用于提升深度确定性策略梯度(Deep Deterministic Policy Gradient, DDPG)算法的性能。在推理阶段,我们的方法利用一个评论家集成从多个并行运行的行动者提出的动作中选取最优动作。通过拥有更大的候选集,我们的方法能够避免具有致命后果的动作,同时保持确定性。使用 ACE,我们以“Megvii-hzwer”之名在 NIPS'17 Learning to Run 竞赛中获得第二名。
引用
@article{arxiv.1712.08987,
title = {Learning to Run with Actor-Critic Ensemble},
author = {Zhewei Huang and Shuchang Zhou and BoEr Zhuang and Xinyu Zhou},
journal= {arXiv preprint arXiv:1712.08987},
year = {2017}
}
备注
3 pages, 4 figures