线性 MDP 中通过在线实验设计实现实例依赖的近最优策略辨识
机器学习
2023-07-21 v2 机器学习
摘要
尽管在理解强化学习(RL)的极小极大样本复杂度——在“最坏情况”实例上学习的复杂度——方面已取得诸多进展,此类复杂度度量往往不能捕捉学习的真实难度。在实践中,对于一个“简单”的实例,我们或许期望达到远优于最坏情况实例上可达成复杂度的结果。本工作中,我们力求理解在带线性函数逼近的 RL 设定下学习近最优策略(PAC RL)的“实例依赖”复杂度。我们提出一种算法 \textsc{Pedel},其实现了一种细粒度的实例依赖复杂度度量,这是函数逼近 RL 设定中的首个此类度量,从而捕捉每个特定问题实例上学习的难度。通过一个显式例子,我们表明 \textsc{Pedel} 相比低遗憾、极小极大最优算法取得了可证明的增益,且此类算法无法达到实例最优速率。我们的方法依赖于一种新颖的基于在线实验设计的流程,其将探索预算聚焦于与学习近最优策略最相关的“方向”,该方法本身可能具有独立意义。
引用
@article{arxiv.2207.02575,
title = {Instance-Dependent Near-Optimal Policy Identification in Linear MDPs via Online Experiment Design},
author = {Andrew Wagenmaker and Kevin Jamieson},
journal= {arXiv preprint arXiv:2207.02575},
year = {2023}
}