中文

用双重强化学习高效打破离屏评估中的视界诅咒

机器学习 2023-01-18 v6 机器学习 最优化与控制

摘要

强化学习中的离屏评估 (OPE) 在长程和无限视界设定下由于行为策略与目标策略之间重叠的衰减而异常困难。在本文中,我们研究马尔可夫和时间不变结构在高效 OPE 中的作用。我们首先推导出当假设上述每种结构时 OPE 的效率界。这精确刻画了视界诅咒:在时间变异过程中,OPE 仅在近同策略设定下可行,即行为策略与目标策略足够相似。但在时间不变的马尔可夫决策过程中,我们的界限表明真正的离屏评估是可行的,即便仅有一条相关轨迹,并给出了我们所能期望表现的上限。我们基于双重强化学习 (DRL) 开发了一个新的估计量,利用我们推导的有效影响函数借助该结构进行 OPE。我们的 DRL 估计量同时使用估计的平稳密度比和 qq-函数,并在两者均以缓慢的非参数速率估计时保持高效,在任一被一致估计时保持一致性。我们研究了这些性质以及利用问题结构实现更高效 OPE 的性能优势。

关键词

引用

@article{arxiv.1909.05850,
  title  = {Efficiently Breaking the Curse of Horizon in Off-Policy Evaluation with Double Reinforcement Learning},
  author = {Nathan Kallus and Masatoshi Uehara},
  journal= {arXiv preprint arXiv:1909.05850},
  year   = {2023}
}

备注

In V3, we significantly changed the derivation of the efficiency bound to follow standard (iid) semiparametric theory. We also derive the efficient influence function. In V4, we add an experiment in a continuous-state environment employing function approximation. In v6, we fixed several typos. Please refer to this version as the final version