分布式系统上用于深度强化学习的元优化
机器学习
2019-02-08 v1 机器学习
摘要
通过强化学习训练智能体是一个众所周知的 unstable 过程。GPU 与分布式系统上的大规模并行化已被用来生成大量训练经验并由此减少不稳定性,但训练的成功仍强烈受超参数选择的影响。为克服此问题,我们引入 HyperTrick,一种新元优化算法,并展示其在分布式系统上学习游玩不同 Atari 游戏时调整深度强化学习超参数的有效应用。我们的分析提供了最优超参数辨识与所学策略之间交互的证据,这是深度强化学习元优化的典型特征。与最先进元优化算法相比,HyperTrick 实现更简单,且能学习相似策略,同时在分布式系统中更有效地利用计算资源。
引用
@article{arxiv.1902.02725,
title = {Metaoptimization on a Distributed System for Deep Reinforcement Learning},
author = {Greg Heinrich and Iuri Frosio},
journal= {arXiv preprint arXiv:1902.02725},
year = {2019}
}