中文

错误设定下离策略值函数估计的最优近似因子

机器学习 2023-12-18 v2 人工智能 机器学习

摘要

已知强化学习(RL)中的理论保证会遭受相对于函数近似的错误设定误差的乘性放大因子。然而,此类\emph{近似因子}的本质——尤其是其在给定学习问题中的最优形式——尚知之甚少。本文在线性离策略值函数估计中研究该问题,其中仍存在许多开放问题。我们在广泛的设定中研究近似因子,例如带加权 L2L_2 范数(权重为离线状态分布)、LL_\infty 范数、存在与不存在状态混叠,以及状态空间完全与部分覆盖。我们确立了所有这些设定下的最优渐近近似因子(至多差常数倍)。特别地,我们的界为 L2(μ)L_2(\mu) 范数识别出两个依赖于实例的因子,而为 LL_\infty 范数仅识别出一个,它们被证明决定了错误设定下离策略评估的困难程度。

关键词

引用

@article{arxiv.2307.13332,
  title  = {The Optimal Approximation Factors in Misspecified Off-Policy Value Function Estimation},
  author = {Philip Amortila and Nan Jiang and Csaba Szepesvári},
  journal= {arXiv preprint arXiv:2307.13332},
  year   = {2023}
}

备注

Accepted to ICML 2023. The arXiv version contains improved results