元梯度强化学习
机器学习
2018-05-25 v1 人工智能
机器学习
摘要
强化学习算法的目标是估计和/或优化价值函数。然而,与监督学习不同,没有教师或预言机可用于提供真实的价值函数。相反,大多数强化学习算法估计和/或优化价值函数的代理。该代理通常基于对真实价值函数的采样和自举近似,被称为回报。回报的特定选择是决定算法性质的主要组成部分之一:未来奖励的折扣率;何时以及如何对价值进行自举;甚至奖励本身的性质。众所周知,这些决定对强化学习算法的整体成功至关重要。我们讨论了一种基于梯度的元学习算法,该算法能够在与环境交互并从中学习的同时,在线适应回报的性质。当应用于 Atari 2600 环境中 57 款游戏超过 2 亿帧时,我们的算法取得了新的 SOTA 性能。
引用
@article{arxiv.1805.09801,
title = {Meta-Gradient Reinforcement Learning},
author = {Zhongwen Xu and Hado van Hasselt and David Silver},
journal= {arXiv preprint arXiv:1805.09801},
year = {2018}
}