中文

对回合排序:程序生成环境中探索的一种简单方法

机器学习 2021-02-05 v2

摘要

稀疏奖励下的探索是无模型强化学习的长期挑战。最先进的方法通过引入内在奖励来鼓励在新颖状态或不确定环境动态中的探索,以应对该挑战。遗憾的是,基于内在奖励的方法往往在程序生成环境中表现不佳,因为每回合都会生成不同的环境,使得智能体不太可能多次访问同一状态。受人类通过审视整个回合来区分良好探索行为的启发,我们提出了RAPID,一种简单而有效的面向程序生成环境的回合级探索方法。RAPID将每回合视为整体,并从单回合与长期两个视角给出回合探索分数。那些高分回合被视为良好的探索行为,并被存储于一个小型排序缓冲区中。随后智能体模仿缓冲区中的回合以复现过去的良好探索行为。我们在多个程序生成的MiniGrid环境、来自MiniWorld的第一人称视角3D迷宫导航任务以及多个稀疏MuJoCo任务上展示了我们的方法。结果表明,RAPID在样本效率与最终性能上显著优于最先进的内在奖励策略。代码见https://github.com/daochenzha/rapid。

关键词

引用

@article{arxiv.2101.08152,
  title  = {Rank the Episodes: A Simple Approach for Exploration in Procedurally-Generated Environments},
  author = {Daochen Zha and Wenye Ma and Lei Yuan and Xia Hu and Ji Liu},
  journal= {arXiv preprint arXiv:2101.08152},
  year   = {2021}
}

备注

Accepted by ICLR 2021