PPO Dash:改进深度强化学习中的泛化能力
机器学习
2019-07-29 v3 人工智能
摘要
深度强化学习易于过拟合,而 Atari 2600 benchmark 等传统基准可能加剧此问题。Obstacle Tower Challenge 通过使用随机化环境以及用于训练、验证与测试运行的独立种子来解决这一问题。本文借助 Obstacle Tower Challenge 考察了针对 PPO 算法的各种改进与最佳实践,以实证方式研究它们对泛化的影响。我们的实验表明,该组合在 Obstacle Tower Challenge 上提供了最先进的性能。
引用
@article{arxiv.1907.06704,
title = {PPO Dash: Improving Generalization in Deep Reinforcement Learning},
author = {Joe Booth},
journal= {arXiv preprint arXiv:1907.06704},
year = {2019}
}
备注
8 pages, 3 figures