中文

利用单次演示结合近端策略优化的引导式探索

人工智能 2021-06-18 v2

摘要

通过探索解决稀疏奖励任务是深度强化学习的主要挑战之一,尤其在三维、部分可观测环境中。关键的是,本文提出的算法利用单个人类演示来解决难探索问题。我们在演示与自身经验相结合的数据上训练智能体,以解决具有可变初始条件的问题。我们采纳该思路并将其与近端策略优化(PPO)相整合。该智能体能够通过重放自身过往轨迹来提升性能并应对更困难的问题,重放时依据所获奖励与轨迹最大值进行优先级排序。我们在 Animal-AI Olympics 环境的一组难探索任务上将本算法的不同变体与行为克隆进行比较。据我们所知,在难度相当的三维环境中仅使用一次人类演示来学习任务此前从未被考虑过。

关键词

引用

@article{arxiv.2007.03328,
  title  = {Guided Exploration with Proximal Policy Optimization using a Single Demonstration},
  author = {Gabriele Libardi and Gianni De Fabritiis},
  journal= {arXiv preprint arXiv:2007.03328},
  year   = {2021}
}