强化学习中的任务无关探索
机器学习
2020-06-18 v1 人工智能
机器学习
摘要
高效的探索是强化学习(RL)的主要挑战之一。大多数现有的样本高效算法假设在探索阶段存在单一的奖励函数。然而,在许多实际场景中,并没有单一的底层奖励函数来引导探索,例如,当智能体需要同时学习多种技能,或需要平衡多个相互冲突的目标时。为应对这些挑战,我们提出了“任务无关 RL”框架:在探索阶段,智能体首先在没有奖励函数引导的情况下通过探索 MDP 来收集轨迹。探索之后,给定为每项任务增强了“采样奖励”的所收集轨迹,其目标是在 个任务上寻找近最优策略。我们提出了一种高效的任务无关 RL 算法 \textsc{UCBZero},该算法在至多 次探索回合后,为 个任意任务找到 -最优策略。我们还给出了一个 的下界,表明对 的 依赖是不可避免的。此外,在真实奖励函数已知的统计上更简单的设定下,我们给出了 \textsc{UCBZero} 的与 无关的样本复杂度界。
引用
@article{arxiv.2006.09497,
title = {Task-agnostic Exploration in Reinforcement Learning},
author = {Xuezhou Zhang and Yuzhe ma and Adish Singla},
journal= {arXiv preprint arXiv:2006.09497},
year = {2020}
}