当简单探索具有样本效率时:随机探索产生 PAC RL 算法的充分条件辨识
机器学习
2019-04-19 v4 人工智能
机器学习
摘要
高效探索是强化学习(RL)算法的关键挑战之一。大多数传统的样本效率界要求策略性探索。近来许多具有简单启发式探索策略(仅有少量形式化保证)的深度 RL 算法在许多领域取得了令人惊讶的成功。这些结果提出了一个重要问题,即如何理解这些探索策略(如 -贪心),以及理解什么刻画了 MDP 中探索的难度。本工作中,我们提出了依赖若干结构性质的随机游走探索下 学习的特定问题样本复杂度界。我们还将理论结果与一些经验基准领域相联系,以说明我们的界在这些领域中是否给出多项式样本复杂度,以及这如何与经验表现相关。
引用
@article{arxiv.1805.09045,
title = {When Simple Exploration is Sample Efficient: Identifying Sufficient Conditions for Random Exploration to Yield PAC RL Algorithms},
author = {Yao Liu and Emma Brunskill},
journal= {arXiv preprint arXiv:1805.09045},
year = {2019}
}
备注
Appeared in The 14th European Workshop on Reinforcement Learning (EWRL), 2018