MADE:通过最大化与已探索区域的偏离进行探索
机器学习
2021-06-21 v1 人工智能
机器学习
摘要
在在线强化学习(RL)中,高效探索在高维稀疏奖励环境下尤为困难。在低维、可采用表格参数化的环境中,基于计数的上置信界(UCB)探索方法达到极小极大近最优率。然而,在涉及非线性函数逼近的现实 RL 任务中如何高效实现 UCB 仍不明晰。为此,我们提出一种通过最大化下一策略的占据分布与已探索区域的偏离来进行探索的新方法。我们将此项作为自适应正则化项加入标准 RL 目标以平衡探索与利用。我们将新目标与可证明收敛的算法配对,从而产生一种调整现有奖励红利的新内在奖励。所提内在奖励易于实现并可与其它现有 RL 算法结合以开展探索。作为概念验证,我们在表格样例上跨多种基于模型与无模型算法评估该新内在奖励,显示出优于仅计数探索策略的提升。在 MiniGrid 与 DeepMind Control Suite 基准的导航与运动任务上测试时,我们的方法相较最先进方法显著提升了样本效率。我们的代码见 https://github.com/tianjunz/MADE。
引用
@article{arxiv.2106.10268,
title = {MADE: Exploration via Maximizing Deviation from Explored Regions},
author = {Tianjun Zhang and Paria Rashidinejad and Jiantao Jiao and Yuandong Tian and Joseph Gonzalez and Stuart Russell},
journal= {arXiv preprint arXiv:2106.10268},
year = {2021}
}
备注
28 pages, 10 figures