中文

面向大规模因果推断的协变量平衡方法

统计方法学 2023-08-04 v2 分布式、并行与集群计算

摘要

随着现代软件和在线平台能够收集海量数据,在无法进行随机实验时,对大规模应用因果推断方法的需求日益增长。直接纳入协变量平衡的重加权方法近年来在观测研究中估计因果效应方面颇受欢迎。这些方法减少了研究者在倾向得分建模与平衡性检验之间反复迭代直至获得满意的协变量平衡结果所需的人工投入。然而,用于确定权重的传统求解器缺乏可扩展性,难以在 Snap Inc. 等公司的大规模数据集上应用此类方法。为克服上述局限并提升计算效率,本文针对熵平衡(entropy balancing)与 MicroSynth 两种平衡方法,提出可扩展算法 DistEB 与 DistMS。这些求解器具有线性时间复杂度,并可便捷地实现于 Spark、Hive 等分布式计算框架中。我们研究了在多达 100 万处理单元与 487 个协变量不同规模下的平衡方法性质。我们发现,随着样本量增大,因果效应估计的偏差与方差均显著降低。结果强调了在大规模数据集上应用平衡方法的重要性。我们将平衡方法与合成控制框架相结合,并在 Snap Inc. 部署了一套端到端的因果影响估计系统。

关键词

引用

@article{arxiv.2302.05549,
  title  = {Balancing Approach for Causal Inference at Scale},
  author = {Sicheng Lin and Meng Xu and Xi Zhang and Shih-Kang Chao and Ying-Kai Huang and Xiaolin Shi},
  journal= {arXiv preprint arXiv:2302.05549},
  year   = {2023}
}

备注

KDD '23: Proceedings of the 29th ACM SIGKDD Conference on Knowledge Discovery and Data Mining