中文

因果估计器的样本外评分与自动选择

机器学习 2022-12-21 v1 统计方法学

摘要

近来,许多用于条件平均处理效应(CATE)和工具变量(IV)问题的因果估计器已发布并开源,可估计随机化处理(如 A/B 测试)与用户选择对关注结果的细粒度影响。然而,此类模型的实际应用因缺乏对其样本外性能的有效评分以选定最佳模型而受阻。我们填补该空白,针对 CATE 情形及一类重要 IV 问题(即工具变量为客户对产品功能的使用权限、处理为客户使用该功能的选择)提出新评分方法。能够样本外评分模型性能,使我们可将超参数优化方法用于因果模型选择与调优。我们在一个开源包中实现了该方法,其依赖 DoWhy 与 EconML 库实现因果推断模型(并含转译结果模型实现),并依赖 FLAML 进行超参数优化及因果模型中组件模型。在合成数据上,我们证明优化所提评分是选择模型及其超参数值、使估计接近真实影响的可靠方法(随机 CATE 与 IV 情形)。此外,提供了将这些方法应用于 Wise 真实客户数据的示例。

关键词

引用

@article{arxiv.2212.10076,
  title  = {Out-of-sample scoring and automatic selection of causal estimators},
  author = {Egor Kraev and Timo Flesch and Hudson Taylor Lekunze and Mark Harley and Pere Planell Morell},
  journal= {arXiv preprint arXiv:2212.10076},
  year   = {2022}
}

备注

9 pages, 6 figures