中文

朴素回归调整多重原因混杂所需假设弱于因子模型

统计方法学 2020-07-28 v1 机器学习 机器学习

摘要

在遗传学、网络、医学和政治学等领域,使用因子模型调整观测性研究中多重处理 A\mathbf{A} 下共享的未观测混杂因子 Z\mathbf{Z} 的经验实践十分普遍。Wang 和 Blei(2019,WB)将这些程序形式化,并开发了“去混杂器”(deconfounder),这是一种因果推断方法,利用 A\mathbf{A} 的因子模型估计“替代混杂因子” Z^\hat{\mathbf{Z}},然后通过将结果 Y\mathbf{Y} 对部分 A\mathbf{A} 回归并调整 Z^\hat{\mathbf{Z}} 来估计处理效应。WB 声称当不存在单原因混杂因子且 Z^\hat{\mathbf{Z}} 被“精准确定”时,去混杂器是无偏的。我们阐明精准确定要求每个混杂因子影响无限多个处理。我们证明在这些假设下,Y\mathbf{Y}A\mathbf{A} 的朴素半参数回归是渐近无偏的。嵌套此回归的去混杂器变体因此也是渐近无偏的,但使用 Z^\hat{\mathbf{Z}} 和原因子集的变体需要更多不可检验的假设。我们用现有数据复现了每一项去混杂器分析,发现它未能一致地优于朴素回归。在实践中,去混杂器在 WB 的电影收入案例研究中产生了难以置信的估计:估计表明漫画作者斯坦·李的客串出场因果性地贡献了 155 亿美元,即漫威电影的大部分收入。我们得出结论,这两种方法在实际应用中都难以替代谨慎的研究设计。

关键词

引用

@article{arxiv.2007.12702,
  title  = {Na\"ive regression requires weaker assumptions than factor models to adjust for multiple cause confounding},
  author = {Justin Grimmer and Dean Knox and Brandon M. Stewart},
  journal= {arXiv preprint arXiv:2007.12702},
  year   = {2020}
}