中文

论离策略评估中依赖未来值函数的未来与历史诅咒

机器学习 2024-10-04 v2 人工智能 机器学习

摘要

我们研究具有复杂观测的部分可观测环境下的离策略评估(OPE),旨在开发其误差保证避免对视野长度产生指数依赖的估计器。虽然此类估计器在 MDP 中存在,且 POMDP 可以转换为基于历史的 MDP,但它们的估计误差依赖于 MDP 的状态密度比,转换后变为历史比率,这是一个呈指数级的对象。最近,Uehara 等人 [2022a] 提出了依赖未来值函数作为解决此问题的有前景的框架,其中对无记忆策略的保证依赖于潜状态空间上的密度比。然而,它也依赖于依赖未来值函数及相关量的有界性,我们证明这些量在长度上可能是指数级的,从而抹杀了该方法的优势。在本文中,我们发现了针对 POMDP 结构量身定制的新型覆盖假设,如结果覆盖和信念覆盖,这使得对上述量的多项式界成为可能。作为副产品,我们的分析还发现了具有互补性质的新算法。

关键词

引用

@article{arxiv.2402.14703,
  title  = {On the Curses of Future and History in Future-dependent Value Functions for Off-policy Evaluation},
  author = {Yuheng Zhang and Nan Jiang},
  journal= {arXiv preprint arXiv:2402.14703},
  year   = {2024}
}