面向目标的高效探索轨迹
机器学习
2018-07-06 v1 机器学习
摘要
探索是强化学习中的一大难题,即便近期最先进的基于好奇心的算法仍依赖简单的 epsilon-greedy 策略来产生新颖性。我们认为纯随机游走在大多数环境中无法妥善拓展探索区域,并提议以随机目标选择并朝其方向行进若干步来替代单步随机动作选择。该方法兼容任何基于好奇心的探索与离策略(off-policy)强化学习智能体,且能生成比单独随机动作更长且更安全的轨迹。为说明这一点,我们提出一个与任务无关的智能体,其学习在屏幕帧中到达坐标,并展示其在游戏 Super Mario Bros. 中探索的能力,显著提升了基线 DQN 智能体的得分。
引用
@article{arxiv.1807.02078,
title = {Goal-oriented Trajectories for Efficient Exploration},
author = {Fabio Pardo and Vitaly Levdik and Petar Kormushev},
journal= {arXiv preprint arXiv:1807.02078},
year = {2018}
}
备注
ICML 2018 Exploration in RL Workshop, videos: https://sites.google.com/view/got-exploration