中文

连续处理的策略评估与优化

机器学习 2018-02-19 v1 机器学习

摘要

我们研究了当处理为连续值时,基于批量上下文赌博机数据的策略评估与学习问题,超越了先前关于离散处理的工作。先前针对离散处理/动作空间的工作侧重于使用拒绝采样方法进行评估、以及使用等价的加权分类问题进行学习的逆概率加权(IPW)和双重稳健(DR)方法。在连续设定下,这种归约会失效,因为我们将几乎必然拒绝所有观测。为处理连续处理的情况,我们使用一个利用处理邻近性来减弱离散拒绝的核函数,将IPW和DR方法扩展到连续设定。我们的策略估计量是一致的,并且我们刻画了最优带宽。使用我们的估计量的连续策略优化器(CPO)方法实现了收敛的遗憾值,并逼近可学习策略类中的最佳策略。我们证明了该估计量表现良好,特别是优于基于离散化的基准。我们进一步在基于华法林患者及其协变量和最终治疗剂量的数据集的个性化给药案例研究中考察了策略优化器的性能。我们学到的策略优于基准并接近预言机最佳线性策略。

关键词

引用

@article{arxiv.1802.06037,
  title  = {Policy Evaluation and Optimization with Continuous Treatments},
  author = {Nathan Kallus and Angela Zhou},
  journal= {arXiv preprint arXiv:1802.06037},
  year   = {2018}
}

备注

appearing at AISTATS 2018