EX2:用于深度强化学习的基于范例模型的探索方法
机器学习
2017-05-30 v2
摘要
深度强化学习算法已被证明能够使用高度泛化的策略类学习复杂任务。然而,稀疏奖励问题仍然是一个重大挑战。基于新颖性检测的探索方法在此类设定中尤为成功,但通常需要观测的生成式或预测模型,而当观测维度非常高且复杂(如原始图像)时,这些模型往往难以训练。我们提出了一种完全基于判别式训练的范例模型的新颖性检测探索算法,其中训练分类器以将每个访问过的状态与所有其他状态区分开来。直观上,新颖状态更容易与训练期间见过的其他状态相区分。我们证明这种判别式建模对应于隐式密度估计,并且它可以与基于计数的探索相结合,在一系列流行的基准任务上取得有竞争力的结果,包括在 vizDoom 基准中具有挑战性的自我中心观测上取得 SOTA 结果。
引用
@article{arxiv.1703.01260,
title = {EX2: Exploration with Exemplar Models for Deep Reinforcement Learning},
author = {Justin Fu and John D. Co-Reyes and Sergey Levine},
journal= {arXiv preprint arXiv:1703.01260},
year = {2017}
}