将奖励预测误差作为深度强化学习中的探索目标
机器学习
2021-01-15 v5 机器学习
摘要
强化学习中的一个主要挑战是探索,当epsilon-greedy采样等局部抖动方法不足以解决给定任务时尤为突出。许多近期方法提出从内在激励智能体去寻求新颖状态,驱动智能体发现改进的奖励。然而,虽然状态新颖性探索方法适用于新颖观测与改进奖励高度相关的任务,但在二者相关性不强的环境中,它们可能并不比epsilon-greedy方法探索得更高效。在本文中,我们区分了寻求新颖状态有助于找到新奖励的探索任务,以及无助于此的任务,例如目标条件任务和逃离局部奖励极大值。我们提出一种新的探索目标,即最大化训练用于预测外在奖励的值函数的奖励预测误差(RPE)。随后我们提出一种深度强化学习方法QXplore,其利用Q函数的时序差分误差来解决高维MDP中的困难探索任务。我们在多个OpenAI Gym MuJoCo任务和Atari游戏上展示了QXplore的探索行为,并观察到QXplore在所有情况下可与基线状态新颖性方法相媲美或更优,在状态新颖性与改进奖励相关性不强的任务上优于基线。
引用
@article{arxiv.1906.08189,
title = {Reward Prediction Error as an Exploration Objective in Deep RL},
author = {Riley Simmons-Edler and Ben Eisner and Daniel Yang and Anthony Bisulco and Eric Mitchell and Sebastian Seung and Daniel Lee},
journal= {arXiv preprint arXiv:1906.08189},
year = {2021}
}
备注
Published at IJCAI 2020, camera-ready version