用于强化学习的混合奖励架构
机器学习
2017-11-29 v2
摘要
强化学习(RL)的主要挑战之一是泛化。在典型的深度 RL 方法中,这是通过使用深度网络以低维表示来逼近最优值函数而实现的。虽然这种方法在许多领域中表现良好,但在最优值函数无法轻易简化为低维表示的领域中,学习可能会非常缓慢且不稳定。本文通过提出一种称为混合奖励架构(Hybrid Reward Architecture, HRA)的新方法,致力于解决此类具有挑战性的领域。HRA 将分解的奖励函数作为输入,并为每个分量奖励函数学习一个单独的值函数。由于每个分量通常仅依赖于所有特征的一个子集,相应的值函数可以更容易地通过低维表示来逼近,从而实现更有效的学习。我们在一个玩具问题和 Atari 游戏 Ms. Pac-Man 上展示了 HRA,其中 HRA 达到了超越人类的性能。
引用
@article{arxiv.1706.04208,
title = {Hybrid Reward Architecture for Reinforcement Learning},
author = {Harm van Seijen and Mehdi Fatemi and Joshua Romoff and Romain Laroche and Tavian Barnes and Jeffrey Tsang},
journal= {arXiv preprint arXiv:1706.04208},
year = {2017}
}