中文

在线性马尔可夫决策过程中无奖励 RL 并不比有奖励 RL 更难

机器学习 2022-06-22 v2 机器学习

摘要

无奖励强化学习(RL)考虑如下设定:智能体在探索期间无法访问奖励函数,但必须为仅在探索后才揭示的任意奖励函数提出一个近最优策略。在表格设定中,众所周知这是一个比有奖励(PAC)RL——智能体在探索期间可访问奖励函数——更困难的问题,两种设定的最优样本复杂度相差 |S| 倍,即状态空间的大小。我们表明这种分离在线性 MDP 设定中不存在。我们首先开发了一种计算高效的算法,用于 d 维线性 MDP 中的无奖励 RL,其样本复杂度随 Õ(d² H⁵/ε²) 缩放。随后我们展示了一个下界,其维度依赖为 Ω(d² H²/ε²) 相匹配,该下界对有奖励 RL 设定也成立。据我们所知,我们的方法是首个在线性 MDP 中实现最优 d 依赖的计算高效算法,即使在单奖励 PAC 设定中也是如此。我们的算法依赖于一种新颖的过程,该过程高效遍历线性 MDP,在任何给定的“特征方向”上收集样本,并享有在(线性 MDP 等价意义上的)最大状态访问概率上最优缩放的样本复杂度。我们表明该探索过程也可应用于解决在线性 MDP 中获取“良态”协变量的问题。

关键词

引用

@article{arxiv.2201.11206,
  title  = {Reward-Free RL is No Harder Than Reward-Aware RL in Linear Markov Decision Processes},
  author = {Andrew Wagenmaker and Yifang Chen and Max Simchowitz and Simon S. Du and Kevin Jamieson},
  journal= {arXiv preprint arXiv:2201.11206},
  year   = {2022}
}