中文

先到达再后探索:内在动机中后探索的益处

机器学习 2023-01-09 v2 人工智能 机器人学

摘要

Go-Explore 在具有稀疏奖励的挑战性强化学习(RL)任务上取得了突破性性能。Go-Explore 的关键洞见是,成功的探索要求智能体首先返回到有趣的状态('Go'),然后才探索未知领域('Explore')。我们将达成目标后的此类探索称为'后探索'。本文在通用的内在动机目标探索过程(IMGEP)框架中呈现了 Go-Explore 论文未给出的关于后探索的清晰消融研究。我们在表格与深度 RL 设置下、在离散导航与连续控制任务上,通过在同一算法中开启和关闭后探索,研究其后探索的独立潜力。在一系列 MiniGrid 与 Mujoco 环境中的实验表明,后探索确实有助于 IMGEP 智能体到达更多样化的状态并提升其性能。简言之,我们的工作表明,RL 研究者在可能时应考虑在 IMGEP 中使用后探索,因为它有效、与具体方法无关且易于实现。

关键词

引用

@article{arxiv.2212.03251,
  title  = {First Go, then Post-Explore: the Benefits of Post-Exploration in Intrinsic Motivation},
  author = {Zhao Yang and Thomas M. Moerland and Mike Preuss and Aske Plaat},
  journal= {arXiv preprint arXiv:2212.03251},
  year   = {2023}
}

备注

arXiv admin note: substantial text overlap with arXiv:2203.16311