用于高效探索的分布强化学习
机器学习
2019-05-16 v1 人工智能
机器学习
摘要
在分布强化学习(RL)中,价值函数分布的估计同时建模了参数不确定性与内在不确定性。我们提出一种新颖且高效的深度 RL 探索方法,其包含两个组成部分。第一部分是一个抑制内在不确定性的衰减调度。第二部分是由所学分布的上分位数计算得到的探索奖励。在 Atari 2600 游戏中,我们的方法在 14 个困难游戏中的 12 个上优于 QR-DQN(在 49 个游戏上相对 QR-DQN 的累积奖励平均提升 483%,并在 Venture 中大幅胜出)。我们还在具有挑战性的 3D 驾驶模拟器(CARLA)中将我们的算法与 QR-DQN 进行比较。结果表明,我们的算法达到近最优安全奖励的速度比 QR-DQN 快一倍。
引用
@article{arxiv.1905.06125,
title = {Distributional Reinforcement Learning for Efficient Exploration},
author = {Borislav Mavrin and Shangtong Zhang and Hengshuai Yao and Linglong Kong and Kaiwen Wu and Yaoliang Yu},
journal= {arXiv preprint arXiv:1905.06125},
year = {2019}
}