基于分位数回归的分布强化学习
人工智能
2017-10-30 v1 机器学习
机器学习
摘要
在强化学习中,智能体通过采取动作并观测下一状态和奖励与环境交互。当以概率方式采样时,这些状态转移、奖励和动作都会给观测到的长期回报带来随机性。传统上,强化学习算法对这种随机性取平均以估计价值函数。本文基于近期倡导的分布式强化学习方法展开研究,该方法显式建模回报的分布而非仅估计均值。即我们研究学习价值分布而非价值函数的方法。我们给出了填补Bellemare、Dabney和Munos(2017)所给理论与算法结果之间若干空白的成果。首先,我们将已有结果推广至近似分布设定。其次,我们提出一种与我们的理论公式一致的新颖分布强化学习算法。最后,我们在Atari 2600游戏上评估该新算法,观察到其显著优于DQN的许多近期改进,包括相关的分布算法C51。
引用
@article{arxiv.1710.10044,
title = {Distributional Reinforcement Learning with Quantile Regression},
author = {Will Dabney and Mark Rowland and Marc G. Bellemare and Rémi Munos},
journal= {arXiv preprint arXiv:1710.10044},
year = {2017}
}