中文

混淆部分可观测马尔可夫决策过程中离策略评估的极小极大学习方法

机器学习 2022-06-17 v4 机器学习

摘要

我们考虑部分可观测马尔可夫决策过程(POMDPs)中的离策略评估(OPE),其中评估策略仅依赖于可观测变量,而行为策略依赖于不可观测潜变量。现有工作要么假设无未测量混淆因子,要么聚焦于观测与状态空间均为表格化的设定。在本工作中,我们首先通过引入将目标策略价值与观测数据分布相联系的桥函数,提出具有潜混淆因子的 POMDP 中 OPE 的新颖辨识方法。我们接下来提出用于学习这些桥函数的极小极大估计方法,并基于这些估计的桥函数构造三个估计量,分别对应于基于价值函数的估计量、边缘化重要性采样估计量和双重稳健估计量。我们的方案允许一般函数逼近,因此适用于具有连续或大型观测/状态空间的设定。我们详细研究了所提估计量的非渐近与渐近性质。

关键词

引用

@article{arxiv.2111.06784,
  title  = {A Minimax Learning Approach to Off-Policy Evaluation in Confounded Partially Observable Markov Decision Processes},
  author = {Chengchun Shi and Masatoshi Uehara and Jiawei Huang and Nan Jiang},
  journal= {arXiv preprint arXiv:2111.06784},
  year   = {2022}
}