中文

线性 MDP 中通过在线实验设计实现实例依赖的近最优策略辨识

机器学习 2023-07-21 v2 机器学习

摘要

尽管在理解强化学习(RL)的极小极大样本复杂度——在“最坏情况”实例上学习的复杂度——方面已取得诸多进展,此类复杂度度量往往不能捕捉学习的真实难度。在实践中,对于一个“简单”的实例,我们或许期望达到远优于最坏情况实例上可达成复杂度的结果。本工作中,我们力求理解在带线性函数逼近的 RL 设定下学习近最优策略(PAC RL)的“实例依赖”复杂度。我们提出一种算法 \textsc{Pedel},其实现了一种细粒度的实例依赖复杂度度量,这是函数逼近 RL 设定中的首个此类度量,从而捕捉每个特定问题实例上学习的难度。通过一个显式例子,我们表明 \textsc{Pedel} 相比低遗憾、极小极大最优算法取得了可证明的增益,且此类算法无法达到实例最优速率。我们的方法依赖于一种新颖的基于在线实验设计的流程,其将探索预算聚焦于与学习近最优策略最相关的“方向”,该方法本身可能具有独立意义。

关键词

引用

@article{arxiv.2207.02575,
  title  = {Instance-Dependent Near-Optimal Policy Identification in Linear MDPs via Online Experiment Design},
  author = {Andrew Wagenmaker and Kevin Jamieson},
  journal= {arXiv preprint arXiv:2207.02575},
  year   = {2023}
}