中文

当简单探索具有样本效率时:随机探索产生 PAC RL 算法的充分条件辨识

机器学习 2019-04-19 v4 人工智能 机器学习

摘要

高效探索是强化学习(RL)算法的关键挑战之一。大多数传统的样本效率界要求策略性探索。近来许多具有简单启发式探索策略(仅有少量形式化保证)的深度 RL 算法在许多领域取得了令人惊讶的成功。这些结果提出了一个重要问题,即如何理解这些探索策略(如 ee-贪心),以及理解什么刻画了 MDP 中探索的难度。本工作中,我们提出了依赖若干结构性质的随机游走探索下 QQ 学习的特定问题样本复杂度界。我们还将理论结果与一些经验基准领域相联系,以说明我们的界在这些领域中是否给出多项式样本复杂度,以及这如何与经验表现相关。

关键词

引用

@article{arxiv.1805.09045,
  title  = {When Simple Exploration is Sample Efficient: Identifying Sufficient Conditions for Random Exploration to Yield PAC RL Algorithms},
  author = {Yao Liu and Emma Brunskill},
  journal= {arXiv preprint arXiv:1805.09045},
  year   = {2019}
}

备注

Appeared in The 14th European Workshop on Reinforcement Learning (EWRL), 2018