非实验数据中数百万随机处理能揭示何种因果?
统计方法学
2022-11-08 v2 人工智能
摘要
我们提出一种从非实验数据估计因果效应的新方法。首先将每对样本单元关联一个随机“处理”——单元间因素的差异——以及一个效应——由此产生的结果差异。接着提出,只要存在一个将处理的组合性质与其效应的准确性与无偏性相连接的统计模型,所有这样的配对都可被合并以提供更准确的观测数据因果效应估计。本文介绍这样一个模型以及一种贝叶斯方法,用以合并非实验数据中通常可用的 对成对观测。这也导致将非实验数据集解释为理想析因实验设计的不完整或含噪版本。这种因果效应估计方法具有若干优势:(1) 它扩充了观测数量,将数千个体转化为数百万观测处理;(2) 从最接近实验理想的处理出发,它识别可在未来忽略的非因果变量,使后续每次迭代中估计更易,同时最小程度偏离类实验条件;(3) 它在异质总体中恢复个体因果效应。我们在模拟与 National Supported Work (NSW) 项目(一个其效应已由随机田野实验确知的被深入研究项目)中评估该方法。我们证明所提方法在常见 NSW 样本、任意子总体以及包含全部国家项目数据、规模大一个数量级的超样本中均能恢复因果效应,且在所有情况下优于统计、计量经济学与机器学习估计量……
引用
@article{arxiv.2105.01152,
title = {What can the millions of random treatments in nonexperimental data reveal about causes?},
author = {Andre F. Ribeiro and Frank Neffke and Ricardo Hausmann},
journal= {arXiv preprint arXiv:2105.01152},
year = {2022}
}