深度去偏的离策略区间估计
机器学习
2021-06-09 v2 人工智能
机器学习
摘要
离策略评估利用由不同行为策略生成的历史数据集来学习目标策略的价值。除点估计外,许多应用若能获得量化点估计不确定性的置信区间(CI)将显著受益。本文中,我们提出一种新颖的深度去偏过程,以构建关于目标策略价值的高效、鲁棒且灵活的CI。我们的方法由理论结果与数值实验所佐证。所提过程的Python实现可在 https://github.com/RunzheStat/D2OPE 获取。
引用
@article{arxiv.2105.04646,
title = {Deeply-Debiased Off-Policy Interval Estimation},
author = {Chengchun Shi and Runzhe Wan and Victor Chernozhukov and Rui Song},
journal= {arXiv preprint arXiv:2105.04646},
year = {2021}
}