中文

面向连续处理设置的深度跳跃学习离屏策略评估

机器学习 2021-11-08 v3 机器学习

摘要

我们考虑连续处理设置(如个性化剂量发现)中的离屏策略评估(OPE)。在 OPE 中,目标是以不同于生成历史数据的决策规则的新处理决策规则,估计平均结果。现有关于 OPE 的工作大多聚焦于离散处理设置。为处理连续处理,我们利用深度跳跃学习发展了一种新的 OPE 估计方法。我们方法的关键要素在于通过深度离散化——借助深度学习和多尺度变点检测——自适应地离散化处治空间。这使我们能够应用现有的离散处理 OPE 方法来处理连续处理。我们的方法进一步由理论结果、模拟以及对华法林给药的真实应用所佐证。

关键词

引用

@article{arxiv.2010.15963,
  title  = {Deep Jump Learning for Off-Policy Evaluation in Continuous Treatment Settings},
  author = {Hengrui Cai and Chengchun Shi and Rui Song and Wenbin Lu},
  journal= {arXiv preprint arXiv:2010.15963},
  year   = {2021}
}