中文

通过椭圆式片段内奖励的探索

机器学习 2023-01-06 v2 人工智能

摘要

近年来,提出了许多强化学习(RL)方法来探索跨片段不同的复杂环境。本工作中,我们表明这些方法的效力关键依赖于其探索奖励中基于计数的片段内项。因此,尽管它们在相对简单、无噪声的设置中成功,这些方法在状态空间广阔且易受噪声影响的更现实场景中表现不足。为解决此限制,我们引入通过椭圆式片段内奖励的探索(E3B),一种将基于计数的片段内奖励扩展到连续状态空间并鼓励智能体在每个片段内探索在所学嵌入下多样状态的新方法。该嵌入使用逆动力学模型学习,以捕获环境的可控方面。我们的方法在来自 MiniHack 套件的 16 个挑战性任务上确立了新的最先进水平,且不需要任务特定的归纳偏置。E3B 在稀疏奖励、基于像素的 VizDoom 环境上也匹配现有方法,并在 Habitat 上的无奖励探索中优于现有方法,表明其可扩展到高维基于像素的观测和现实环境。

关键词

引用

@article{arxiv.2210.05805,
  title  = {Exploration via Elliptical Episodic Bonuses},
  author = {Mikael Henaff and Roberta Raileanu and Minqi Jiang and Tim Rocktäschel},
  journal= {arXiv preprint arXiv:2210.05805},
  year   = {2023}
}