论离策略评估中依赖未来值函数的未来与历史诅咒
机器学习
2024-10-04 v2 人工智能
机器学习
摘要
我们研究具有复杂观测的部分可观测环境下的离策略评估(OPE),旨在开发其误差保证避免对视野长度产生指数依赖的估计器。虽然此类估计器在 MDP 中存在,且 POMDP 可以转换为基于历史的 MDP,但它们的估计误差依赖于 MDP 的状态密度比,转换后变为历史比率,这是一个呈指数级的对象。最近,Uehara 等人 [2022a] 提出了依赖未来值函数作为解决此问题的有前景的框架,其中对无记忆策略的保证依赖于潜状态空间上的密度比。然而,它也依赖于依赖未来值函数及相关量的有界性,我们证明这些量在长度上可能是指数级的,从而抹杀了该方法的优势。在本文中,我们发现了针对 POMDP 结构量身定制的新型覆盖假设,如结果覆盖和信念覆盖,这使得对上述量的多项式界成为可能。作为副产品,我们的分析还发现了具有互补性质的新算法。
引用
@article{arxiv.2402.14703,
title = {On the Curses of Future and History in Future-dependent Value Functions for Off-policy Evaluation},
author = {Yuheng Zhang and Nan Jiang},
journal= {arXiv preprint arXiv:2402.14703},
year = {2024}
}