从大型历史数据与小型随机试验中预测反事实
机器学习
2016-10-27 v2
摘要
当考虑使用一种新处理(无论是药物还是搜索引擎排序算法)时,一个典型问题是:其性能是否会超过当前处理?回答这一反事实问题的常规方法是通过运行受控随机实验来估计新处理相对于常规处理的效果。尽管该方法在理论上确保无偏估计量,但它存在若干缺陷,包括难以找到具代表性的实验群体以及运行此类试验的成本。此外,此类试验忽视了大量可用的对照条件数据,这些数据常被完全忽略。在本文中,我们提出一个判别框架,用于在给定大型对照条件数据集以及比较新旧处理的小型(且可能不具代表性)随机试验数据的情况下,估计新处理的性能。我们的目标对处理仅需极小假设,对不同条件下的结果之间的关系进行建模。这使我们不仅能估计平均效应,还能对随机样本之外的实例生成个体预测。我们通过三个领域的实验展示我们方法的效用:搜索引擎运营、糖尿病患者的治疗以及房屋市场价值估计。我们的结果表明,我们的方法能够减少当前所执行随机对照实验的数量与规模,从而为从业者节省大量时间、金钱与精力。
引用
@article{arxiv.1610.07667,
title = {Predicting Counterfactuals from Large Historical Data and Small Randomized Trials},
author = {Nir Rosenfeld and Yishay Mansour and Elad Yom-Tov},
journal= {arXiv preprint arXiv:1610.07667},
year = {2016}
}