中文

POMDP中基于未来依赖价值的离屏策略评估

机器学习 2023-11-16 v2 机器学习

摘要

我们研究具有一般函数近似的部分可观测MDP(POMDP)的离屏策略评估(OPE)。现有方法如序列重要性采样估计量和拟合Q评估在POMDP中受限于视界诅咒。为规避此问题,我们提出一种新颖的无模型OPE方法,引入以未来代理变量为输入的未来依赖价值函数。未来依赖价值函数在完全可观测MDP中扮演与经典价值函数类似的角色。我们推导出未来依赖价值函数的新贝尔曼方程,作为以历史代理变量为工具变量的条件矩方程。我们进一步提出一种极小极大学习方法,利用新贝尔曼方程学习未来依赖价值函数。我们得到了PAC结果,意味着只要未来和历史包含关于潜状态的充分信息且贝尔曼完备,我们的OPE估计量就是一致的。最后,我们将方法扩展到动力学学习,并建立我们的方法与POMDP中著名的谱学习方法之间的联系。

关键词

引用

@article{arxiv.2207.13081,
  title  = {Future-Dependent Value-Based Off-Policy Evaluation in POMDPs},
  author = {Masatoshi Uehara and Haruka Kiyohara and Andrew Bennett and Victor Chernozhukov and Nan Jiang and Nathan Kallus and Chengchun Shi and Wen Sun},
  journal= {arXiv preprint arXiv:2207.13081},
  year   = {2023}
}

备注

This paper was accepted in NeurIPS 2023