中文

IncomeSCM:从表格数据集到时序模拟器与因果估计基准

机器学习 2024-10-29 v3 统计方法学

摘要

评估观察因果效应的估计器需要稀缺信息:来自感兴趣人群的无偏干预和结果,通常通过随机化或调整实现。因此,人们常常依赖模拟器来创建基准任务。虽然模拟器提供了很大的控制力,但往往过于简单,难以制造具有挑战性的任务,因为它们要么是手工设计的,缺乏真实数据的细微差别,要么是拟合观察数据而无结构约束。本文提出了一种通用、可重复的策略,将观察数据转化为序列结构因果模型和具有挑战性的估计任务,遵循两个简单原则:1)尽可能拟合真实数据,2)通过组合简单的手工机制来创建复杂性。我们在高度可配置的软件包中实现了这些想法,并将其应用于著名的成人收入数据集,以构建 IncomeSCM 模拟器。从中,我们构思了多个估计任务并抽样数据集,以比较已建立的因果效应估计器。这些任务具有适当的挑战性,尽管在事实结果的建模中表现相似,但不同方法的效应估计质量差异很大,凸显了对专用因果估计器和模型选择标准的必要性。

关键词

引用

@article{arxiv.2405.16069,
  title  = {IncomeSCM: From tabular data set to time-series simulator and causal estimation benchmark},
  author = {Fredrik D. Johansson},
  journal= {arXiv preprint arXiv:2405.16069},
  year   = {2024}
}