一种用于混杂离屏策略评估的工具变量方法
机器学习
2023-02-03 v2 机器学习
统计方法学
摘要
离屏策略评估(OPE)是一种利用由可能不同的行为策略生成的预收集观测数据来估计目标策略收益的方法。在某些情况下,可能存在未测量的变量会混杂动作-奖励或动作-下一状态关系,导致许多现有OPE方法失效。本文提出了一种基于工具变量(IV)的方法,用于在混杂马尔可夫决策过程(MDP)中进行一致的OPE。与单阶段决策类似,我们表明IV也使我们能够在无限时域设定下正确识别目标策略的价值。此外,我们提出了一种高效且鲁棒的价值估计器,并通过大量仿真以及来自世界领先短视频平台真实数据的分析说明了其有效性。
引用
@article{arxiv.2212.14468,
title = {An Instrumental Variable Approach to Confounded Off-Policy Evaluation},
author = {Yang Xu and Jin Zhu and Chengchun Shi and Shikai Luo and Rui Song},
journal= {arXiv preprint arXiv:2212.14468},
year = {2023}
}