中文

强化学习中的任务无关探索

机器学习 2020-06-18 v1 人工智能 机器学习

摘要

高效的探索是强化学习(RL)的主要挑战之一。大多数现有的样本高效算法假设在探索阶段存在单一的奖励函数。然而,在许多实际场景中,并没有单一的底层奖励函数来引导探索,例如,当智能体需要同时学习多种技能,或需要平衡多个相互冲突的目标时。为应对这些挑战,我们提出了“任务无关 RL”框架:在探索阶段,智能体首先在没有奖励函数引导的情况下通过探索 MDP 来收集轨迹。探索之后,给定为每项任务增强了“采样奖励”的所收集轨迹,其目标是在 NN 个任务上寻找近最优策略。我们提出了一种高效的任务无关 RL 算法 \textsc{UCBZero},该算法在至多 O~(log(N)H5SA/ϵ2)\tilde O(\log(N)H^5SA/\epsilon^2) 次探索回合后,为 NN 个任意任务找到 ϵ\epsilon-最优策略。我们还给出了一个 Ω(log(N)H2SA/ϵ2)\Omega(\log (N)H^2SA/\epsilon^2) 的下界,表明对 NNlog\log 依赖是不可避免的。此外,在真实奖励函数已知的统计上更简单的设定下,我们给出了 \textsc{UCBZero} 的与 NN 无关的样本复杂度界。

关键词

引用

@article{arxiv.2006.09497,
  title  = {Task-agnostic Exploration in Reinforcement Learning},
  author = {Xuezhou Zhang and Yuzhe ma and Adish Singla},
  journal= {arXiv preprint arXiv:2006.09497},
  year   = {2020}
}