利用反事实元策略学习高效且有效的探索策略
机器学习
2019-05-29 v1 机器学习
摘要
强化学习算法中的一个基本问题是在对环境探索和利用智能体已获取信息之间的平衡。特别是,探索对学习过程的效率和效果都起着关键作用。然而,现有的探索工作涉及任务无关的设计,即在一个环境中表现良好,却不适合另一个环境。为了以自动化方式学习有效且高效的探索策略,我们基于反事实思想形式化了一种衡量探索效用的可行度量。在此基础上,我们提出了一种端到端的元学习算法来学习探索策略。我们证明了与以往工作在 MuJoCo 模拟器中的高维控制任务相比,我们的方法取得了良好结果。
引用
@article{arxiv.1905.11583,
title = {Learning Efficient and Effective Exploration Policies with Counterfactual Meta Policy},
author = {Ruihan Yang and Qiwei Ye and Tie-Yan Liu},
journal= {arXiv preprint arXiv:1905.11583},
year = {2019}
}