面向连续处理设置的深度跳跃学习离屏策略评估
机器学习
2021-11-08 v3 机器学习
摘要
我们考虑连续处理设置(如个性化剂量发现)中的离屏策略评估(OPE)。在 OPE 中,目标是以不同于生成历史数据的决策规则的新处理决策规则,估计平均结果。现有关于 OPE 的工作大多聚焦于离散处理设置。为处理连续处理,我们利用深度跳跃学习发展了一种新的 OPE 估计方法。我们方法的关键要素在于通过深度离散化——借助深度学习和多尺度变点检测——自适应地离散化处治空间。这使我们能够应用现有的离散处理 OPE 方法来处理连续处理。我们的方法进一步由理论结果、模拟以及对华法林给药的真实应用所佐证。
引用
@article{arxiv.2010.15963,
title = {Deep Jump Learning for Off-Policy Evaluation in Continuous Treatment Settings},
author = {Hengrui Cai and Chengchun Shi and Rui Song and Wenbin Lu},
journal= {arXiv preprint arXiv:2010.15963},
year = {2021}
}