中文

深度抽象化状态下的离策略评估

机器学习 2025-03-05 v3 机器学习

摘要

离策略评估 (OPE) 对于在部署前评估目标策略的影响至关重要。然而,在大规模状态空间中实现准确的 OPE 仍然具有挑战性。本文研究了最初为策略学习而设计的状态抽象化方法在 OPE 语境中的应用。我们的贡献有三点:(i) 我们定义了学习为 OPE 设计状态抽象化的 irrelevance 条件集,并推导了一种backward-model-irrelevance 条件,可通过构建时间反向马尔可夫决策过程 (MDP) 来实现 %顺序和 (边缘化) importance sampling 比率中的 irrelevance。(ii) 我们提出了一种新颖的迭代程序,依次将原始状态空间投射到更小的空间,从而产生深度抽象化状态,显著简化了来自高基数样本复杂度的 OPE。(iii) 我们证明了当应用于我们提出的抽象状态空间时,各种 OPE 估计器的 Fisher 一致性。

关键词

引用

@article{arxiv.2406.19531,
  title  = {Off-policy Evaluation with Deeply-abstracted States},
  author = {Meiling Hao and Pingfan Su and Liyuan Hu and Zoltan Szabo and Qingyuan Zhao and Chengchun Shi},
  journal= {arXiv preprint arXiv:2406.19531},
  year   = {2025}
}

备注

56 pages, 5 figures