中文

非参数模型下情节式部分可观测马尔可夫决策过程的离屏策略评估

机器学习 2022-10-18 v2 机器学习 统计理论 统计理论

摘要

我们研究了具有连续状态的情节式部分可观测马尔可夫决策过程(POMDPs)的离屏策略评估(OPE)问题。受最近提出的近端因果推断框架的启发,我们借助时变代理变量,通过一系列所谓的 V-bridge 函数,给出了估计策略价值的非参数识别结果。随后我们开发了一种拟合-Q-评估型算法来递归估计 V-bridge 函数,其中每一步都求解一个非参数工具变量(NPIV)问题。通过分析这一具有挑战性的序列 NPIV 问题,我们建立了估计 V-bridge 函数以及相应策略价值评估的有限样本误差界,其依赖于样本量、时域长度以及每一步所谓的(局部)不适定性度量。据我们所知,这是非参数模型下 POMDPs 中 OPE 的首个有限样本误差界。

关键词

引用

@article{arxiv.2209.10064,
  title  = {Off-Policy Evaluation for Episodic Partially Observable Markov Decision Processes under Non-Parametric Models},
  author = {Rui Miao and Zhengling Qi and Xiaoke Zhang},
  journal= {arXiv preprint arXiv:2209.10064},
  year   = {2022}
}