中文

未观测混杂下序贯决策的离屏策略评估

机器学习 2020-03-13 v1 机器学习

摘要

当观测到的决策仅依赖于观测特征时,面向序贯决策问题的离屏策略评估(OPE)方法能够在部署评估策略之前估计其性能。由于未观测混杂因素(影响决策及其结果的未记录变量)的存在,这一假设经常被违背。我们通过建立评估策略性能的最坏情况界限,来评估 OPE 方法在未观测混杂下的鲁棒性。当未观测混杂因素可影响一个回合中的每一次决策时,我们证明即便每步决策中少量的混杂也会严重偏置 OPE 方法。幸运的是,在医疗、政策制定、运营和技术领域的若干重要场景中,未观测混杂因素可能主要仅影响众多决策中的某一个。在此较不悲观的单步决策混杂模型下,我们提出一种基于高效损失最小化的流程来计算最坏情况界限,并证明其统计一致性。在两个模拟医疗实例——脓毒症患者管理和自闭症儿童发育干预——中,该混杂模型较为合理,我们证明我们的方法能够否定非鲁棒结果并提供有意义的鲁棒性证书,从而即使在未观测混杂下也能可靠地选择策略。

关键词

引用

@article{arxiv.2003.05623,
  title  = {Off-policy Policy Evaluation For Sequential Decisions Under Unobserved Confounding},
  author = {Hongseok Namkoong and Ramtin Keramati and Steve Yadlowsky and Emma Brunskill},
  journal= {arXiv preprint arXiv:2003.05623},
  year   = {2020}
}