协变量偏移下外部有效性的离屏策略评估与学习
机器学习
2020-10-19 v3 机器学习
计量经济学
摘要
我们考虑利用从不同策略获得的历史数据来评估并训练用于评估数据的新策略。离屏策略评估(OPE)的目标是估计新策略在评估数据上的期望奖励,而离屏策略学习(OPL)的目标是找到在评估数据上最大化期望奖励的新策略。尽管标准 OPE 和 OPL 假设历史数据与评估数据之间协变量分布相同,但协变量偏移常常存在,即历史数据的协变量分布不同于评估数据的协变量分布。在本文中,我们推导了协变量偏移下 OPE 的效率界。然后,我们利用历史与评估数据分布之间密度比的非参数估计量,提出了协变量偏移下 OPE 和 OPL 的双重稳健高效估计量。我们还讨论了其他可能的估计量并比较了它们的理论性质。最后,我们通过实验验证了所提估计量的有效性。
引用
@article{arxiv.2002.11642,
title = {Off-Policy Evaluation and Learning for External Validity under a Covariate Shift},
author = {Masahiro Kato and Masatoshi Uehara and Shota Yasui},
journal= {arXiv preprint arXiv:2002.11642},
year = {2020}
}