中文

强化学习中用于纯探索的快速主动学习

机器学习 2020-10-13 v2 机器学习

摘要

现实环境通常向智能体提供非常有限的反馈。当环境初始未知时,初期的反馈可能完全缺失,智能体可能首先选择将所有精力用于高效探索。探索仍是一项挑战,一方面已有许多具有不同通用性水平的手工调参启发式方法应对,另一方面也有少数理论支撑的探索策略。其中许多体现为内在动机,特别是探索奖励。探索奖励的一个常见经验法则是使用加到奖励经验估计上的 1/n1/\sqrt{n} 奖励,其中 nn 是该特定状态(或状态-动作对)被访问的次数。我们表明,令人惊讶的是,对于无奖励探索这一纯探索目标,1/n1/n 尺度奖励带来了更快的学习率,在关于时域 HH 的依赖性方面改进了已知的上界。此外,我们表明通过对停止时间进行改进的分析,可以在最优策略辨识设定下将样本复杂度改进一个因子 HH,这是另一个纯探索目标,其中环境提供奖励但智能体在探索阶段的行为不受惩罚。

关键词

引用

@article{arxiv.2007.13442,
  title  = {Fast active learning for pure exploration in reinforcement learning},
  author = {Pierre Ménard and Omar Darwiche Domingues and Anders Jonsson and Emilie Kaufmann and Edouard Leurent and Michal Valko},
  journal= {arXiv preprint arXiv:2007.13442},
  year   = {2020}
}