中文

情境化 MDP 中用于探索的全局与片段式奖励研究

人工智能 2023-06-07 v1

摘要

近年来,跨片段变化的环境中的探索问题受到越来越多的关注。现有方法将全局新颖性奖励(使用智能体整个训练经验计算)与片段新颖性奖励(仅使用当前片段的经验计算)以某种方式结合使用。然而,这两类奖励的使用一直是临时性的且理解不足。本工作中,我们通过可解释任务以及具有挑战性的基于像素的设置上的受控实验,阐明这两类奖励的行为。我们发现两类奖励在不同设置中成功:当片段间共享结构很少时片段式奖励最有效,而当共享结构较多时全局奖励有效。我们开发了一个概念框架,通过考虑价值函数跨情境的方差使共享结构这一概念精确化,并为我们的实证结果提供统一解释。此外,我们发现结合两类奖励可在不同共享结构程度下带来更鲁棒的性能,并基于函数近似研究了定义与结合全局和片段式奖励的不同算法选择。由此得到的算法在先前工作所用的 MiniHack 套件 16 个任务上树立了新 SOTA,并在 Habitat 与 Montezuma's Revenge 上表现鲁棒。

关键词

引用

@article{arxiv.2306.03236,
  title  = {A Study of Global and Episodic Bonuses for Exploration in Contextual MDPs},
  author = {Mikael Henaff and Minqi Jiang and Roberta Raileanu},
  journal= {arXiv preprint arXiv:2306.03236},
  year   = {2023}
}