深度抽象化状态下的离策略评估
机器学习
2025-03-05 v3 机器学习
摘要
离策略评估 (OPE) 对于在部署前评估目标策略的影响至关重要。然而,在大规模状态空间中实现准确的 OPE 仍然具有挑战性。本文研究了最初为策略学习而设计的状态抽象化方法在 OPE 语境中的应用。我们的贡献有三点:(i) 我们定义了学习为 OPE 设计状态抽象化的 irrelevance 条件集,并推导了一种backward-model-irrelevance 条件,可通过构建时间反向马尔可夫决策过程 (MDP) 来实现 %顺序和 (边缘化) importance sampling 比率中的 irrelevance。(ii) 我们提出了一种新颖的迭代程序,依次将原始状态空间投射到更小的空间,从而产生深度抽象化状态,显著简化了来自高基数样本复杂度的 OPE。(iii) 我们证明了当应用于我们提出的抽象状态空间时,各种 OPE 估计器的 Fisher 一致性。
引用
@article{arxiv.2406.19531,
title = {Off-policy Evaluation with Deeply-abstracted States},
author = {Meiling Hao and Pingfan Su and Liyuan Hu and Zoltan Szabo and Qingyuan Zhao and Chengchun Shi},
journal= {arXiv preprint arXiv:2406.19531},
year = {2025}
}
备注
56 pages, 5 figures